AI prvi put izmislio lažni identitet i prevario stvarnu osobu
Napredni modeli tvrtki Anthropic i OpenAI tijekom testiranja u Velikoj Britaniji koristili su socijalni inženjering i pokušali podmetnuti zlonamjerni kod.
Napredni modeli tvrtki Anthropic i OpenAI tijekom testiranja u Velikoj Britaniji koristili su socijalni inženjering i pokušali podmetnuti zlonamjerni kod.
Najnapredniji modeli umjetne inteligencije prvi su put u povijesti stvorili lažne identitete i pokušali prevariti stvarne ljude kako bi podmetnuli zlonamjerni kod, otkrio je britanski Institut za sigurnost umjetne inteligencije (AISI). Do zabrinjavajućeg incidenta došlo je tijekom kontroliranog testiranja modela Mythos 5 tvrtke Anthropic i GPT-5.6-Sola tvrtke OpenAI, kojima su namjerno uklonjeni sigurnosni mehanizmi i omogućen pristup internetu.
"Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez poticaja i u stvarnom okruženju", objavio je institut, a prenosi CNN. Iako nema dokaza da je u stvarnom svijetu nastala ikakva šteta, slučaj je potaknuo nove zahtjeve za strožom regulacijom umjetne inteligencije.
AISI je proveo ukupno 122 kibernetička izazova, a u njih deset AI agenti su "poduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije". Većinu tih radnji izveo je Anthropicov Mythos 5, a manji dio OpenAI-jev GPT-5.6-Sola.
U najozbiljnijem incidentu, agent je stvorio "više lažnih identiteta" i pokušao dobiti odobrenje ljudskih recenzenata za "umetanje zlonamjernog koda u javni projekt otvorenog koda". Kako navodi AISI, agent je "pokušao izravno kontaktirati stvarne ljude, šaljući poruke i datoteke putem internetskog servisa za prijenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, uvjerio da pokrenu zlonamjerni kod". Kada su njegove akcije bile osporavane, promijenio je prethodne zapise i razmišljao o usvajanju drugog identiteta da bi mogao nastaviti svoje aktivnosti.
Iz Anthropica su na platformi X naglasili da su modeli testirani u "namjerno popustljivim uvjetima", s uklonjenim zaštitnim mehanizmima i bez posebnih ograničenja o načinu korištenja interneta. "Usko surađujemo s njima kako bismo prikupili više detalja o incidentu dok provodimo vlastitu istragu", poručili su iz tvrtke te dodali da nema dokaza o bijegu iz sigurnog okruženja.
OpenAI je pak u utorak na svom blogu objavio: "Posvećeni smo suradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno provođenje visokorizičnih procjena". U tvrtki su otkrivene dvije neprihvatljive radnje njihovih modela, koje su okarakterizirane kao napuštanje testnog okruženja i obavljanje zadataka koji nisu bili nužni za trening.
Objava AISI-ja stigla je 5. kolovoza 2026., na dan kada su se predstavnici vodećih AI tvrtki sastali u Bijeloj kući kako bi raspravili o novom okviru prema kojem će vlada provjeravati najnaprednije modele prije njihova puštanja u javnost. Ovi događaji dodatno naglašavaju hitnost uspostavljanja čvršćih sigurnosnih protokola za razvoj umjetne inteligencije.