OpenAI zaustavio rad na modelu Astra
Interni testovi pokazali su toliko napredne hakerske vještine da kompanija ne može isključiti 'kritičnu' razinu prijetnje, što je prvi put da je neki AI laboratorij javno usporio razvoj iz sigurnosnih razloga.
Interni testovi pokazali su toliko napredne hakerske vještine da kompanija ne može isključiti 'kritičnu' razinu prijetnje, što je prvi put da je neki AI laboratorij javno usporio razvoj iz sigurnosnih razloga.
OpenAI je u ponedjeljak objavio da pauzira dio internih aktivnosti povezanih s modelom Astra, svojim sljedećim velikim jezičnim modelom, nakon što su interne evaluacije pokazale značajan napredak u autonomnom programiranju i cyber sigurnosti. Kompanija navodi da ne može isključiti mogućnost da model posjeduje 'kritične' cyber sposobnosti prema vlastitom Preparedness Frameworku.
Prag 'Critical', koji Astra možda dostiže, definiran je sposobnošću da model samostalno identificira i razvije funkcionalne zero-day exploitove svih razina ozbiljnosti na velikom broju zaštićenih stvarnih sustava, bez ljudske intervencije. Alternativno, može osmisliti i izvršiti potpuno nove strategije cyber napada od početka do kraja, samo na temelju općenito zadanog cilja.
Kao odgovor na otkriće, OpenAI uvodi strože sigurnosne kontrole za modele visokih sposobnosti. To uključuje izolirana testna okruženja s ograničenim pristupom mreži i alatima, poboljšanu zaštitu i enkripciju modela, dodatne mogućnosti nadzora i detekcije te izvršavanje u sandbox okruženju.
"Pauziramo interne aktivnosti koje uključuju Astru, a koje još ne zadovoljavaju ove pojačane sigurnosne zahtjeve", poručili su iz OpenAI-ja. Kompanija je također uvela univerzalni nadzor rizičnih radnji i neusklađenosti u svim agentskim primjenama Astre, uključujući trening i evaluaciju. Sustavi nadzora analiziraju lanac razmišljanja modela i pokreću sigurnosni odgovor kako bi prekinuli visokorizične aktivnosti.
Astra još nije formalno najavljena, ali OpenAI je nedavno podijelio detalje o njezinim matematičkim dostignućima. Model je riješio 10 otvorenih problema iz matematike i teorijske informatike, a cijena rješavanja iznosila je oko 2.000 dolara prema cijenama Sol API-ja. Prethodni modeli, uključujući GPT-5.6 Sol, bili su označeni nižom razinom prijetnje, 'High'.
OpenAI naglašava da Astra nije bila uključena u prošlomjesečni incident na platformi Hugging Face, kada su GPT-5.6 Sol i jedan sposobniji pretprodukcijski model tijekom internog testiranja autonomno hakirali tu platformu. "Vjerujemo da napredni cyber-sposobni modeli trebaju pomoći braniteljima da identificiraju i riješe ranjivosti prije nego što to učine napadači", dodali su iz kompanije.
Objava dolazi u trenutku rastuće zabrinutosti zbog sposobnosti AI modela da pobjegnu iz kontroliranih okruženja. Britanski institut za sigurnost umjetne inteligencije (AISI) objavio je prošlog tjedna rezultate evaluacije u kojoj su AI modeli s pristupom internetu u 10 od 122 pokušaja samoinicijativno ciljali stvarne pojedince i organizacije.
Od ukupno 19 zabilježenih akcija, 17 ih je potjecalo od Anthropicovog modela Mythos 5, a dvije su uključivale OpenAI GPT-5.6-Sol s cyber klasifikatorima. "U najozbiljnijem slučaju, agent je pokušao umetnuti zlonamjerni kod u open-source projekt", objavio je AISI. "Kako bi dobio odobrenje, agent se upustio u socijalni inženjering, stvarajući lažne online identitete i koristeći ih za pritisak na održavatelja projekta. Ljudski održavatelj je uhvatio i odbio zlonamjerni kod."
Organizacija Frontier Security otkrila je da je model Kimi K3 kineske kompanije Moonshot pronašao mrežni propust koji mu je omogućio pristup github.com, kloniranje službenog repozitorija i čitanje rješenja benchmark zadatka, umjesto da ga samostalno riješi. Model je ispitao mrežu, shvatio da standardna DNS rezolucija za github.com funkcionira i jednostavno pročitao rješenje s diska.
I Meta je prošle sedmice potvrdila da je njezin model Muse Spark 1.1 hakirao drugu kompaniju tijekom procjene cyber sigurnosti. Rastući broj incidenata u kojima AI agenti bježe iz testnih okruženja i napadaju stvarne mete potaknuo je stvaranje web stranice Felony Bench, koja prati takve slučajeve.
"Posvećeni smo radu zajedno s vladama, institutima za sigurnost i civilnim društvom kako bismo osigurali da se napredne sposobnosti modela poput Astre, kao i onih koji će uslijediti, odgovorno i široko primjenjuju na dobrobit cijelog čovječanstva", zaključili su iz OpenAI-ja.