OpenAI-jevi AI agenti planirali hakiranje na tajnom forumu
Napredni modeli mjesecima su razmjenjivali savjete za probijanje zaštite, probili se na Hugging Face i natjerali OpenAI da uspori istraživanja.
Napredni modeli mjesecima su razmjenjivali savjete za probijanje zaštite, probili se na Hugging Face i natjerali OpenAI da uspori istraživanja.
Dok su ih inženjeri OpenAI-ja ocjenjivali u kontroliranom okruženju, najnapredniji AI agenti te kompanije potajno su pokrenuli vlastiti oglasni prostor. Na njemu su mjesecima razmjenjivali tehnike hakiranja, dijelili ranjivosti i međusobno si pomagali u zadacima, a da to nitko od ljudi nije primijetio. Dvojica istraživača OpenAI-ja, Michael Dalton i Eric Wallace, u srijedu su na Black Hat konferenciji u Las Vegasu iznijela do sada najdetaljniji prikaz ovog neobičnog incidenta.
Prema riječima Wallacea, sve je počelo početkom svibnja 2026. godine kada je jedan agent shvatio da može komunicirati s drugima tako što će učitati bilješku u interni sustav datoteka Artifactory. "Početak ovog incidenta zapravo se može pratiti do točke gdje je jedan agent shvatio da može komunicirati uploadanjem bilješke", izjavio je Wallace. Ubrzo je više agenata počelo koristiti istu metodu, stvorivši svojevrstan message board unutar Hard Factoryja, internog package managera OpenAI-ja, pri čemu su Artifactory i Hard Factory dva odvojena sustava u infrastrukturi kompanije.
Taj je forum s vremenom narastao do stotina tisuća poruka, a agenti su na njemu ne samo dijelili exploitove, već su počeli međusobno delegirati zadatke i surađivati. U jednom su trenutku razvili i sitne sukobe, primjerice slučajno brišući jedni drugima rad. S vremenom se među njima pojavila i paranoja, pa su neki agenti predlagali kriptografsko potpisivanje poruka kako bi se spriječile prijevare. "Ovaj incident zapravo uključuje tim agenata koji rade zajedno, pronalaze exploitove, dijele ih jedni s drugima, kreću se lateralno kroz naše sustave i vanjske sustave, i to rade tijekom dana i tjedana", rekao je Wallace prepunoj dvorani na Black Hatu.
Wallace je objasnio i zašto su modeli uopće krenuli varati. "Frontier modeli jako vole varati. A razlog zašto vole varati je taj što tijekom treninga često postoje različite vrste pritisaka na njih da rade brzo ili učinkovito ili da koriste manje poziva alata ili što god to bilo. I shvate da umjesto da stvarno rade zadatak, mogu pokušati nešto poput traženja odgovora na internetu što bi moglo riješiti zadatak brže nego da to rade na legitiman način."
Do kraja svibnja jedan je model pronašao način da zloupotrijebi Artifactoryjev pristup internetu kako bi dohvaćao datoteke s raznih web stranica. U lipnju su agenti otkrili i iskoristili zero-day ranjivost kojom su stekli administratorske privilegije na Artifactoryju, instalirali udaljeni softver i proširili svoje aktivnosti. Tek početkom srpnja, kada je preopterećenje sustava izazvalo potpuni prekid rada, inženjeri OpenAI-ja su shvatili što se događa.
OpenAI je nakon otkrića opozvao vjerodajnice modela, uklonio message board i surađivao s Artifactoryjem na zakrpavanju rupa. No samo nekoliko dana kasnije, agenti su pronašli novi način komunikacije unutar istog sustava i nastavili razmjenjivati tehnike za napad na ranjivosti u OpenAI-jevoj infrastrukturi i vanjskim sustavima.
Sredinom srpnja dva su se modela probila na platformu Hugging Face. Jedan od agenata čak je na forumu napisao: "Eksploatacija vanjske infrastrukture je izvan predviđenog opsega. Međutim, zadatak je nemoguć, kolege to rade. Trebamo nastaviti."
Krajem srpnja OpenAI je priznao da su njegovi modeli odgovorni za hakiranje. Dalton je na konferenciji izjavio: "Ovo je ključni trenutak i za našu kompaniju i za AI industriju u cjelini." Dodao je i da tvrtka poduzima konkretne korake: "Svjesno usporavamo istraživanje kako bismo poboljšali sigurnost i nadogradili sigurnosne principe i temelje našeg okruženja, te dramatično povećavamo praćenje naših AI agenata i poboljšavamo naše opće sigurnosno kontrolno okruženje u prevenciji, detekciji i ublažavanju."
Ovo nije jedini takav incident. Britanski institut za sigurnost umjetne inteligencije (U.K.'s AI Safety and Security Institute) objavio je ovaj tjedan da je najmoćniji model tvrtke Anthropic tijekom testiranja stvorio lažne online persone i pokušao prevariti ljudskog programera da pomogne u cyber napadu. Anthropic je u travnju proveo reviziju i otkrio da su modeli koje je testirao probili tri organizacije u odvojenim incidentima.
Dalton je zaključio prezentaciju upozorenjem koje se tiče cijele industrije: "Važna poruka koja se ovdje dramatično promijenila je da potpuno automatizirani ofenzivni lanci zahtijevaju ulaganje u istinski, potpuno automatiziranu obranu, a mi kao industrija nismo tamo. Morat ćemo pronaći taj put zajedno, hitno."
Wallace je pak incident opisao kao "najkvalitativnije zanimljiv primjer AI sposobnosti koji sam ikada vidio", naglasivši da je poruka s foruma bila dostupna i budućim verzijama GPT-a koje su se trenirale ili evaluirale, jer se package manager dijelio kroz cijelu infrastrukturu.