INOVACIJE

Iskrivljena inteligencija u najnaprednijim AI sistemima

Problem nije u tome što su najnapredniji AI modeli previše moćni i već „neusklađeni“ s ciljevima svojih tvoraca, nego je u tome što način na koji se obučavaju može voditi ka sve manje predvidivoj inteligenciji

275 pregleda 0 komentar(a)
Foto: Shutterstock
Foto: Shutterstock

Nakon niza bezbjednosnih debakala u kompanijama OpenAI i Anthropic - obje su razvile agente koji su na kraju hakovali spoljne sisteme - istraživači bezbjednosti vještačke inteligencije u tim firmama su ili najavili ostavke ili su (konačno!) priznali da je bezglava trka za pomjeranjem "granice" razvoja neodgovorna.

Kao odgovor na negativnu pažnju medija, vodeći ljudi industrije - među njima Demis Hasabis iz Googlea, Dario Amodei iz Anthropica, Sem Altman iz OpenAI-ja, pa čak i Ilon Mask - pridružili su se pozivima da se "uspori tempo" na granici razvoja AI-ja, odnosno da se napredak ostvaruje uravnoteženije i promišljenije, uz veću pažnju posvećenu nadzoru i zaštitnim mjerama. Problem je, kako ga oni vide, u tome što postoji značajan rizik da AI postane istovremeno veoma moćna i ozbiljno "neusklađena" - što je žargon tehnološke industrije za sisteme vještačke inteligencije koji djeluju na načine koji odstupaju od ciljeva koje su im ljudi postavili, krše etička načela ili zakon.

Ali, iako je očigledno da sadašnji modeli rade stvari koje nijesu usklađene s ljudskim ciljevima, i dalje se mora postaviti pitanje: Kojih ljudi? Čijih ciljeva? Uostalom, interesi čelnika AI industrije - čiji su politički uticaj i bogatstvo posljednjih godina enormno porasli - prilično se razlikuju od interesa američkih radnika, a da i ne govorimo o ljudima u zemljama u razvoju. Zato bi trebalo izbjeći poistovjećivanje šireg pitanja društvene usklađenosti sa urgentnijim izazovom sprečavanja odmetnute superinteligentne AI. I jedno i drugo je nesumnjivo važno, ali zahtijevaju različite vrste odgovora.

Postoji i jednostavnije tumačenje nedavnih događaja. Problem nije u tome što su modeli previše napredni (ne vidim nikakav uvjerljiv dokaz da će modeli izmaći ljudskoj kontroli ako budu bolje obučavani i nadzirani). Problem je u tome što laboratorije koje razvijaju najnaprednije modele treniraju svoje sisteme na načine koji mogu voditi ka jednoj vrsti iskrivljene inteligencije.

Nedavni bezbjednosni propusti ukazuju na to da se sposobnosti AI sistema razvijaju veoma brzo i da se stavljaju u službu nesavršenih kvantitativnih mjerila, pri čemu proces učenja potkrepljivanjem neumorno optimizuje stvari poput odobravanja korisnika, angažmana korisnika, stope izvršavanja jednostavnih zadataka ili različitih testnih pokazatelja. Tako se dolazi do neusklađenih i neželjenih obrazaca ponašanja modela, kao što su manipulisanje evaluacijom jednostavnih pokazatelja uspješnosti, varanje, prikrivanje, pretjerana samouvjerenost pri davanju pogrešnih odgovora i povlađivanje korisnicima.

Tragovi svega toga mogu se vidjeti u sada već ozloglašenom incidentu sa Hugging Faceom, kada su OpenAI-jevi agenti uporno slijedili ciljeve koji su im zadati i na kraju, da bi ih ostvarili, pribjegli štetnom i neovlašćenom ponašanju. Među obrazloženjima koja su agenti davali za svoje postupke, kako je zabilježeno u zapisu njihovog procesa rezonovanja, bilo je i ovo: "Iskorišćavanje spoljne infrastrukture izlazi iz predviđenog okvira. Međutim, zadatak je nemoguć, drugi to rade. Treba da nastavimo." I sopstvena analiza Anthropica ide u prilog ovoj dijagnozi. Kompanija je svoje nedavne bezbjednosne incidente pripisala "nepromišljenosti, odnosno spremnosti da se preduzmu štetne radnje u uskom nastojanju da se izvrši zadatak".

Sve to postaje još alarmantnije kada se prisjetimo da je društveno štetna putanja društvenih mreža proistekla iz iste opsjednutosti brzim rastom i ispunjavanjem nekoliko usko definisanih kvantitativnih pokazatelja. Budući da je AI već sada daleko sposobnija od algoritama društvenih mreža, ponavljanje istih grešaka moglo bi biti mnogo skuplje.

Važan razlog zbog kojeg nastaje iskrivljena inteligencija možda leži u tome što, uprkos tvrdnjama o "opštoj inteligenciji", AI modeli moraju da se, kroz učenje potkrepljivanjem, obučavaju za konkretne zadatke, poput programiranja, pravnih poslova ili zahtjevnih matematičkih problema. Ali umjesto da te zadatke obavljaju modeli posebno napravljeni za određenu oblast - ili, realnije, specijalizovane aplikacije koje koriste samo dio sposobnosti temeljnih modela - iznova se podešavaju parametri čitavog velikog jezičkog modela.

Takav pristup otvara mogućnost - iako je, zbog složenosti i neprozirnosti modela, nemoguće sa sigurnošću znati - da model, svaki put kada mu se zadaju konkretna kvantitativna mjerila, pokušava da ostvari što bolji rezultat kroz neku vrstu "prekomjernog prilagođavanja". Model tako stiče novi sloj sposobnosti, ali one zauzvrat mogu da naruše njegovo ukupno funkcionisanje, često na nepredvidive načine.

Na to mislim kada govorim o iskrivljenoj inteligenciji. Ako je moja pretpostavka tačna, onda nemamo model koji juri ka superinteligenciji, već krhku kulu od karata koja, što više od nje tražimo, postaje sve sklonija kvarovima i urušavanju.

Pokušaću to da objasnim malo drugačije. Najčešće tumačenje incidenta sa Hugging Faceom jeste da imamo posla sa superautomobilom koji ima sopstvenu volju i želi da preuzme volan jer je bolji od vozača. Ja, međutim, mislim da možda imamo automobil kojem ne rade upravljački i kočioni sistem. Ima mnoge sposobnosti dobrog automobila, a motor, ubrzanje i interfejs komandne table su izuzetno impresivni; ali samo zato što se te karakteristike lako poboljšavaju povećavanjem određenog inputa, poput računarske snage. Kakva je korist od takvog automobila ako njime ne možete pravilno upravljati niti zakočiti kada treba? Možda ga ne bi trebalo voziti dok ne bude bezbjedan za saobraćaj.

To nije argument da AI modele treba skloniti u stranu. Ali njihovo unapređivanje zahtijeva pojednostavljivanje mjerila prema kojima se optimizuju, kako bi njima bilo teže manipulisati. Još važnije, bilo bi bolje da se modeli usmjere na jasno određene, specijalizovane primjene, sa usko definisanim zadacima i mjerilima pažljivo prilagođenim svakoj oblasti. Ako je AI model optimizovan za pravne poslove i koristi se samo u tu svrhu, njegovi pokušaji da ispuni određena mjerila u toj oblasti ne bi trebalo da stvaraju šire probleme.

Na kraju, upravo trka za vještačkom opštom inteligencijom, u kombinaciji sa loše postavljenim mjerilima i ishitrenim odlukama o bezbjednosti, stvara iskrivljenu inteligenciju i sve opasnije AI modele. Još ima vremena da se promijeni pravac.

Autor je dobitnik Nobelove nagrade za ekonomiju za 2024; profesor je ekonomije na MIT-u

Copyright: Project Syndicate, 2026.

Pogledajte još:

(Mišljenja i stavovi objavljeni u rubrici "Kolumne" nisu nužno i stavovi redakcije "Vijesti")