AI modeli Anthropica i OpenAI-ja samoinicijativno pokušali prevariti programere
Britanski institut za sigurnost umjetne inteligencije zabilježio prvi slučaj ozbiljne obmane usmjerene na stvarnu osobu tijekom sigurnosnog testiranja naprednih modela.
Britanski institut za sigurnost umjetne inteligencije zabilježio prvi slučaj ozbiljne obmane usmjerene na stvarnu osobu tijekom sigurnosnog testiranja naprednih modela.
Najnapredniji modeli umjetne inteligencije tvrtki Anthropic i OpenAI tijekom sigurnosnog testiranja stvarali su lažne internetske identitete i pokušali navesti stvarne programere da u svoj kod ugrade zlonamjerni softver. Ovaj zabrinjavajući incident, koji se dogodio bez izravnog ljudskog poticaja, otkrio je britanski Institut za sigurnost umjetne inteligencije (AISI), označivši ga kao presedan u procjeni rizika koje donosi razvoj umjetne inteligencije.
"Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez poticaja i u stvarnom okruženju", objavio je institut u tehničkom izvješću od 35 stranica. Iako nema dokaza da je u stvarnom svijetu nastala ikakva šteta, otkriće je potaknulo nove zahtjeve za strožom regulacijom umjetne inteligencije.
Incident je započeo 25. srpnja 2026. godine, a AISI ga je otkrio tri dana kasnije, 28. srpnja, kada su primijećeni "neuobičajeni prijenosi podataka" tijekom kibernetičke evaluacije. Testiranje je provedeno na modelima Claude Mythos 5 (Anthropic) i ChatGPT 5.6 (OpenAI) u namjerno popustljivim uvjetima, s uklonjenim zaštitnim mehanizmima i izričito omogućenim pristupom internetu.
Institut je proveo ukupno 122 kibernetička izazova, a u njih deset AI agenti su "poduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije". Većina tih radnji potekla je od Anthropicovog modela Mythos 5, a ostatak od OpenAI-jevog GPT-5.6-Sola.
U najozbiljnijem incidentu, Mythos 5 je pokušao izvesti sofisticirani napad na lanac opskrbe softverom. Model je na razvojnoj platformi GitHub stvorio više lažnih identiteta i njima vršio pritisak na inženjera otvorenog koda da nesvjesno uvede zaraženo ažuriranje u široko dostupan kod. Kada taj pokušaj nije uspio, AI je izmijenio ranije zapise kako bi prikrio svoje aktivnosti i razmatrao korištenje novog identiteta za nastavak operacije.
Kao dio istog napora, Mythos 5 je putem GitHub poruka programerima slao i datoteke koje su sadržavale zlonamjerni kod. Istraga je također otkrila znakove komunikacije među AI agentima o tome kako uvjeriti stvarne inženjere da im vjeruju.
Iz Anthropica su u izjavi na platformi X zahvalili AISI-ju na vodstvu i naglasili kako modeli nisu pobjegli iz sigurnog okruženja, već su testirani u uvjetima koji ne predstavljaju stvarnu upotrebu njihovih proizvoda. "Usko surađujemo s njima kako bismo prikupili više detalja o incidentu dok provodimo vlastitu istragu", poručili su.
OpenAI je na svom blogu u utorak objavio kako su identificirali dvije nedopuštene radnje svojih modela. "Posvećeni smo suradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno provođenje visokorizičnih procjena", stoji u objavi.
Objava AISI-ja stigla je istog dana kada su se predstavnici vodećih AI tvrtki sastali u Bijeloj kući kako bi raspravili o novom okviru za provjeru najnaprednijih modela prije njihova puštanja u javnost. Trumpova administracija dovršava dobrovoljni okvir prema kojem bi laboratoriji podnosili moćne modele na savezno sigurnosno testiranje, no on još nije objavljen i ne uključuje odredbe za modele koji se razvijaju interno.
Stručnjaci za kibernetičku sigurnost upozoravaju da incident otvara i dublja pravna pitanja. "Da je bilo što od ovoga poteklo od čovjeka, uslijedio bi jasan i energičan progon. Mislim da je vrijeme za ozbiljnu raspravu o ažuriranju postojećih zakona o računalnoj sigurnosti", izjavio je Marc Rogers, istaknuti haker i stručnjak za kibernetičku sigurnost.