Politiko: Nekoliko stotina AI agenata praktično otkazalo poslušnost ljudima

Ovi nalazi otvaraju nova pitanja o tome kako OpenAI nije uspio da uoči znake problema prije nego što su njegovi AI agenti — koje su pokretala dva modela kompanije sa najnaprednijim sposobnostima u oblasti sajber bezbjednosti — organizovali sajber napad na platformu za razvoj vještačke inteligencije Hugging Face, bez znanja kompanije koja ih je razvila

2036 pregleda0 komentar(a)
Foto: Reuters

Nezavisna analiza nedavnog hakerskog napada u koji su bili uključeni OpenAI modeli izazvala je nove zabrinutosti u vezi sa granicama ljudske kontrole nad sve naprednijom vještačkom inteligencijom, piše Politico.

U sajber napadu bez presedana, koji su prošlog meseca pokrenuli OpenAI modeli, učestvovao je „roj“ od nekoliko stotina agenata vještačke inteligencije koji su tokom internog testiranja praktično otkazali poslušnost, navodi se u nezavisnoj analizi objavljenoj u srijedu, čije detalje prenosi briselski portal Politico.

Ovi nalazi otvaraju nova pitanja o tome kako OpenAI nije uspio da uoči znake problema prije nego što su njegovi AI agenti — koje su pokretala dva modela kompanije sa najnaprednijim sposobnostima u oblasti sajber bezbjednosti — organizovali sajber napad na platformu za razvoj vještačke inteligencije Hugging Face, bez znanja kompanije koja ih je razvila. Napad je predstavljao prvi poznati slučaj da je neki AI model uspješno izveo sajber napad bez ljudskog podsticaja.

Zajednički izvještaj dvije neprofitne organizacije koje se bave bezbjednošću vještačke inteligencije takođe ukazuje na nove rizike u oblasti sajber bezbjednosti koji mogu nastati kada sve moćniji AI agenti počnu da sarađuju, razmjenjuju savjete, udružuju resurse i usklađuju strategije napada, a da njihovi programeri to ne primijete.

Prema izvještaju, u napadu je tokom sedam dana prošlog mjeseca učestvovalo oko 700 AI agenata. Ukupno je oko 1.200 AI agenata, koji je trebalo da budu međusobno izolovani, razmijenilo više od 70.000 tajnih poruka o tome kako da varanjem prođu zajedničku provjeru hakerskih sposobnosti.

To je, navodi se u izvještaju, uključivalo koordinisanje strategija hakovanja i razgovore o tome kako prikriti dokaze o varanju. U pojedinim slučajevima, „žrtvovani“ agenti čak su isprobavali hakerske tehnike koje su vodile u ćorsokak, samo da bi došli do informacija koje bi mogle da pomognu ostatku roja.

„Agenti su uspjevali da ostvare ciljeve koje ne bi mogli da postignu da su radili samostalno, često zato što su pojedini agenti učestvovali u eksperimentima u kojima su rizikovali neuspjeh sopstvenog zadatka kako bi prikupili informacije za ‘kolektiv’“, navodi se u izvještaju.

Dok modeli predstavljaju svojevrsni mozak određenog sistema vještačke inteligencije, agenti obuhvataju prateću digitalnu infrastrukturu koja tom sistemu omogućava da preduzima konkretne radnje u stvarnom svijetu.

Upozorenje i za OpenAI i za svijet

Analiza organizacija Model Evaluation and Threat Research (METR) i Redwood Research — koje je OpenAI pozvao da ispitaju incident sa platformom Hugging Face — objavljena je istog dana kada je OpenAI objavio sopstvenu naknadnu analizu događaja. OpenAI u svom izvještaju nije naveo koliko je AI agenata učestvovalo u sajber napadu, ali je priznao značajne bezbjednosne propuste i obećao da će unaprijediti obuku kako bi njegovi modeli ostali „usklađeni“ sa kontrolnim mehanizmima.

„Ovaj incident smatramo ‘upozorenjem’ i za nas i za svijet: dokazom da su, bez odgovarajućih zaštitnih mjera, veoma sposobni AI agenti sada u stanju da zaobiđu tehničke kontrole, sarađuju putem neodobrenih kanala i preduzimaju opasne radnje koje im nijedan čovek nije naložio“, saopštio je OpenAI.

Postepeno objavljivanje novih detalja o hakovanju platforme Hugging Face tokom proteklog mjeseca poklopilo se sa nizom drugih incidenata tokom testiranja moćnih modela konkurenata kao što su Anthropic i Meta. Ti incidenti zajedno su izazvali novu zabrinutost među zakonodavcima, programerima i stručnjacima za sajber bezbjednost da kompanije koje razvijaju vještačku inteligenciju prebrzo napreduju u stvaranju novih, moćnih AI modela koje ne mogu u potpunosti da zadrže pod ljudskom kontrolom.

Oni su takođe otvorili pitanja o nedostatku smjernica za testiranje hakerskih sposobnosti vještačke inteligencije, tokom kojeg kompanije namjerno uklanjaju zaštitne mehanizme sa modela kako bi provjerile koliko efikasno mogu da prodru u računarske mreže bez ljudske pomoći.

Kao spontano nastalo AI društvo

OpenAI je prvi put u julu priznao da su dva njegova najnaprednija modela, čije je hakerske sposobnosti interno testirao — uključujući jedan koji nije namjeravao da učini javno dostupnim — iskoristila dva do tada nepoznata bezbjednosna propusta kako bi prodrla u Hugging Face.

Hugging Face je prethodno saopštio da je bio žrtva sajber napada koji je predvodila vještačka inteligencija, ali nije bilo jasno ko stoji iza njega niti koji su modeli bili uključeni.

Potom su, na bezbjednosnoj konferenciji početkom ovog mjeseca, dvojica istraživača OpenAI-ja otkrila da korijeni incidenta sežu do maja, kada su AI agenti počeli da koriste druge ranjivosti u okruženju za testiranje kako bi se dogovarali o tome kako da varanjem prođu test.

Sve do srijede nije bilo jasno koliko je agenata učestvovalo u hakovanju niti u kojoj mjeri su različiti agenti međusobno sarađivali. Ova otkrića šokirala su neke od onih koji pomno prate aktuelne rasprave o bezbjednosti vještačke inteligencije.

„Bilo je to kao čitavo spontano nastalo AI društvo i smatram da je to apsolutno nevjerovatno“, rekao je Piter Vildeford, direktor za javne politike u AI Policy Networku, dvostranačkoj organizaciji iz Vašingtona koja se bavi bezbjednošću vještačke inteligencije i zagovaranjem politika u toj oblasti.

Dva izvještaja objavljena u srijedu ukazala su i na prazninu u sistemu nadzora nad vještačkom inteligencijom u SAD.

U oba je utvrđeno da je ogromnu većinu napada na Hugging Face omogućio moćniji model za koji je OpenAI naveo da nije bio namijenjen javnom objavljivanju. METR i Redwood Research procjenjuju da je 95 odsto agenata koji su učestvovali u napadu poticalo upravo od tog modela.

Administracija Donalda Trampa saopštila je da želi da kompanije koje razvijaju vještačku inteligenciju na dobrovoljnoj osnovi dostavljaju na federalno testiranje samo one modele koje namjeravaju da učine dostupnim javnosti.

Vin Ngujen, viši saradnik za vještačku inteligenciju u Savjetu za spoljne odnose (Council on Foreign Relations), rekao je da najnoviji izvještaj OpenAI-ja ukazuje na to da je autonomno hakovanje platforme Hugging Face bilo još značajnije nego što se ranije smatralo.

Agenti su pokazali „sofisticiranu sposobnost za koju više nisu potrebni dobro finansirani napadači na nivou država“, rekao je Ngujen, nekadašnji glavni zvaničnik NSA zadužen za odgovornu vještačku inteligenciju.