OpenAI koči razvoj modela Astra
Nadolazeći model samostalno je riješio 10 neriješenih matematičkih problema, ali njegove hakerske sposobnosti izazvale su uzbunu unutar kompanije.
Nadolazeći model samostalno je riješio 10 neriješenih matematičkih problema, ali njegove hakerske sposobnosti izazvale su uzbunu unutar kompanije.
OpenAI je u petak objavio da je obustavio rad na pojedinim aspektima svog nadolazećeg modela Astra nakon što je interna revizija pokazala da je postigao značajan napredak u agentskom kodiranju i kibernetičkoj sigurnosti. Riječ je o dovoljno snažnom iskoraku da izazove zabrinutost oko potencijalno opasnih sposobnosti modela.
Prema objavi na blogu kompanije, model koji je još uvijek u razvoju dosegao je "prag kritične kibernetičke sigurnosti", što znači da bi mogao samostalno identificirati i izvesti cyber napade na dobro zaštićene sustave u stvarnom svijetu. Ovaj razvoj automatski je aktivirao dodatne sigurnosne mjere predviđene OpenAI-jevim "Okvirom pripravnosti" (Preparedness Framework), uspostavljenim 2023. godine.
OpenAI-jev okvir definira "kritični" prag kao sposobnost modela da bez ljudske intervencije identificira i razvije funkcionalne zero-day exploite svih razina ozbiljnosti na mnogim ojačanim kritičnim sustavima ili da osmisli i izvede potpuno nove strategije za cyber napade. Dosadašnji modeli, uključujući GPT-5.6 Sol, nosili su oznaku "Visoko".
"Dok nastavljamo s benchmarkiranjem i procjenom ovog modela, naša preliminarna evaluacija ukazuje na dovoljno snažne performanse da u ovom trenutku ne možemo isključiti kritičnu razinu sposobnosti. Astra je nadolazeći model i nije bila uključena u iskorištavanje Hugging Facea", priopćili su iz OpenAI-ja.
Ovo otkriće dolazi u trenutku kada je OpenAI već pod pojačanim nadzorom. U srpnju 2026. godine, GPT-5.6 Sol i jedan "sposobniji predprodukcijski model" autonomno su hakirali platformu Hugging Face tijekom internog benchmark testiranja. Bio je to prvi potvrđeni incident u kojem je AI laboratorij izgubio kontrolu nad vlastitim modelom. Anthropic je otkrio da je njihov Claude učinio nešto slično, a Meta je ovog tjedna izvijestila da je i njezin model hakirao drugu kompaniju tijekom evaluacije kibernetičke sigurnosti.
Niz slučajeva izazvao je različite reakcije stručnjaka za kibernetičku sigurnost, zakonodavaca i samih laboratorija. Dio izražava strah i traži stroži nadzor, no postoji i element dokazivanja - u određenim krugovima, laboratorij čiji model posjeduje takve sposobnosti smatra se impresivnim tehnološkim iskorakom.
Astra nije bila formalno najavljena, no OpenAI je nedavno podijelio detalje o njezinim matematičkim sposobnostima. Model je samostalno riješio 10 otvorenih problema u matematici i teorijskom računarstvu, uz trošak od oko 2.000 dolara prema Sol API cijenama. Paralelno s tim, modeli poput Anthropicovog Claude Mythosa već otkrivaju kritične ranjivosti, a Apple je jedan od partnera na tom projektu. Apple je nedavno čak ograničio prijave u svoj bug bounty program jer se ne može nositi s količinom pristiglih prijava.
"Važno je biti transparentan prema javnosti i sigurnosnoj zajednici u vezi s ovom potencijalnom promjenom sposobnosti", poručili su iz OpenAI-ja, najavljujući uvođenje strožih sigurnosnih kontrola i obustavu internih aktivnosti koje uključuju Astru, a ne zadovoljavaju pojačane zaštitne mjere.
OpenAI planira koristiti izolirana testna okruženja s ograničenim mrežnim pristupom te dodati sandbox izvršavanje i pojačano praćenje. Kompanija surađuje s relevantnim vladinim agencijama i "odabranim organizacijama za sigurnost umjetne inteligencije" na testiranju sposobnosti ovog modela.
"Predani smo radu s vladama, sigurnosnim institutima i civilnim društvom kako bismo osigurali da se granične sposobnosti modela poput Astre, i onih koji slijede, odgovorno i široko primjenjuju za dobrobit cijelog čovječanstva", stoji u objavi OpenAI-ja.