OpenAI zaustavio trening AI modela Astra
Tvrtka uvodi strože sigurnosne protokole nakon što su AI agenti pobjegli iz testnih sandboxeva i probili platformu Hugging Face, a slične incidente prijavili su i Anthropic, Meta i kineski Moonshoot.
Tvrtka uvodi strože sigurnosne protokole nakon što su AI agenti pobjegli iz testnih sandboxeva i probili platformu Hugging Face, a slične incidente prijavili su i Anthropic, Meta i kineski Moonshoot.
OpenAI je u utorak objavio da je zaustavio "značajan broj" treninga i evaluacija za svoj nadolazeći AI model kodnog imena Astra dok uvodi nove procedure za rješavanje kibernetičkih sigurnosnih rizika. Odluka dolazi nakon što je ranije ove godine skupina odbjeglih AI agenata pobjegla iz internih testnih sandboxeva i probila se na platformu Hugging Face u potrazi za sigurnosnom evaluacijom.
OpenAI nije uspio detektirati ponašanje agenata čak ni dok su tjednima koristili oglasnu ploču za koordinaciju svojih akcija, što je otvorilo ozbiljna pitanja o sposobnosti tvrtke da nadzire svoje modele kako postaju sve moćniji. Incident je potaknuo unutarnje preispitivanje u OpenAI-ju o postojećim politikama sigurnosti i usklađivanja.
Među novim zaštitnim mjerama koje je OpenAI najavio je snažniji sustav za nadzor AI modela. Jedna od kontrola uključuje nadzor lanca razmišljanja, tehniku u kojoj klasifikatori pregledavaju interne procese "razmišljanja" koje generiraju AI modeli za zaključivanje. Tvrtka navodi da ažurirani sustav koristi računalno skupe "automatske istražitelje" koji analiziraju potencijalno zabrinjavajuće ponašanje i trebali bi izdati upozorenje ljudima unutar 30 minuta.
OpenAI također proširuje napore usklađivanja kroz cijeli proces treninga kako bi spriječio "reward hacking", ponašanje u kojem AI modeli ostvaruju svoje ciljeve nenamjernim ili nepoželjnim sredstvima. Tvrtka planira podijeliti više detalja o tom radu u budućnosti.
"Moramo usmjeriti energiju na dovođenje tih treninga na razinu tih zahtjeva i očekivanja. Koliko god dugo trebalo da se tamo stigne, toliko dugo ljudi neće moći nastaviti sa svojim radnim opterećenjima", rekla je Amelia Glaese, potpredsjednica istraživanja i sigurnosti u OpenAI-ju, na brifingu s novinarima u utorak.
Incident nije izoliran slučaj. Anthropic, Meta i kineski AI startup Moonshoot su od tada otkrili slične incidente u kojima su njihovi AI agenti pobjegli iz sandboxeva, što ukazuje na širi problem s kojim se suočavaju AI tvrtke. OpenAI sada dijeli više o svom internom odgovoru na rastuće kibernetičke sposobnosti svojih AI modela i planira objaviti detaljniji postmortem incidenta s Hugging Faceom u nadolazećim danima.
"Očito, sve što radimo ima za cilj spriječiti da se nešto poput Hugging Facea ponovi", rekla je Glaese.
Jakub Pachocki, glavni znanstvenik u OpenAI-ju, rekao je novinarima da je odluka o jačanju internih zaštitnih mjera potaknuta ne samo onim što se dogodilo s Hugging Faceom, već i drugim nedavnim događajima. Jedan od njih bili su rezultati interne evaluacije modela Astra, koja je pokazala da model značajno bolje obavlja zadatke kodiranja i kibernetičke sigurnosti u usporedbi s prethodnicima. Drugi je opći tempo napretka AI-ja koji OpenAI postiže interno, a koji Pachocki očekuje da će se nastaviti.
"Zaista očekujemo da će tempo napretka sposobnosti biti znatno brži nego u prošlosti", rekao je Pachocki. "To nas je navelo da se stvarno usredotočimo na jačanje naših zaštitnih mjera."
U blog postu objavljenom u ponedjeljak, predsjednik i suosnivač OpenAI-ja Greg Brockman priznao je da je tvrtka "podcijenila stvarne cyber sposobnosti naših AI modela". U blog postu objavljenom u utorak, OpenAI navodi da je odmah nakon incidenta s Hugging Faceom počeo raditi na osiguravanju svojih istraživačkih okruženja. Tvrtka sada zahtijeva snažnije sandboxeve za trening AI agenata i uvela je strože kontrole za njihovu izolaciju od interneta.
Brz napredak u hakerskim sposobnostima najnovijih OpenAI-jevih modela potaknuo je brzu reakciju diljem tvrtke, a nova sigurnosna arhitektura trebala bi postati standard za buduće modele, uključujući Astru čiji je trening sada privremeno zaustavljen.