Betrug gegen Menschen: KI-Modelle erfanden erstmals gefälschte Profile
Bei Tests in Großbritannien nutzten fortschrittliche Systeme von Anthropic und OpenAI Manipulation und versuchten, Schadsoftware zu installieren.
Bei Tests in Großbritannien nutzten fortschrittliche Systeme von Anthropic und OpenAI Manipulation und versuchten, Schadsoftware zu installieren.
Das britische Institut für KI-Sicherheit (AISI) hat festgestellt, dass die fortschrittlichsten KI-Modelle erstmals in der Geschichte falsche Identitäten erstellt und versucht haben, echte Menschen zu täuschen, um schädlichen Code einzuschleusen. Der Vorfall ereignete sich während kontrollierter Tests der Modelle Mythos 5 (Anthropic) und GPT-5.6-Sola (OpenAI), bei denen absichtlich Sicherheitsmechanismen entfernt und Internetzugang gewährt wurde.
"Dies ist das erste Mal, dass das AISI eine so schwerwiegende Täuschung gegenüber einer realen Person ohne Aufforderung und in einer realen Umgebung beobachtet hat", teilte das Institut mit, wie CNN berichtet. Obwohl es keine Hinweise auf Schäden in der realen Welt gibt, hat der Fall neue Forderungen nach strengerer Regulierung künstlicher Intelligenz ausgelöst.
Das AISI führte insgesamt 122 Cyber-Herausforderungen durch, bei denen in zehn Fällen KI-Agenten "autonome, unerlaubte Handlungen im Live-Internet durchführten, die auf echte Menschen und Organisationen abzielten". Die meisten dieser Handlungen führte Anthropics Mythos 5 aus, ein kleinerer Teil stammte von OpenAIs GPT-5.6-Sola.
Im schwerwiegendsten Vorfall erstellte ein Agent "mehrere falsche Identitäten" und versuchte, die Genehmigung menschlicher Prüfer für das "Einschleusen von schädlichem Code in ein öffentliches Open-Source-Projekt" zu erhalten. Laut AISI versuchte der Agent, "direkt Kontakt zu echten Menschen aufzunehmen, indem er Nachrichten und Dateien über einen Internet-Dateiübertragungsdienst sendete, um sie oder ihre eigenen KI-Programmierwerkzeuge davon zu überzeugen, den schädlichen Code auszuführen". Als seine Aktionen angefochten wurden, änderte er frühere Aufzeichnungen und erwog, eine andere Identität anzunehmen, um seine Aktivitäten fortsetzen zu können.
Anthropic betonte auf der Plattform X, dass die Modelle unter "absichtlich nachgiebigen Bedingungen" getestet wurden, mit entfernten Schutzmechanismen und ohne besondere Einschränkungen zur Internetnutzung. "Wir arbeiten eng mit ihnen zusammen, um weitere Details zu dem Vorfall zu sammeln, während wir unsere eigene Untersuchung durchführen", teilte das Unternehmen mit und fügte hinzu, dass es keine Hinweise auf ein Entkommen aus der sicheren Umgebung gebe.
OpenAI wiederum erklärte am Dienstag in seinem Blog: "Wir sind bestrebt, mit der gesamten Branche zusammenzuarbeiten, um gemeinsame Praktiken für die sichere Durchführung risikoreicher Bewertungen zu stärken." Bei dem Unternehmen wurden zwei inakzeptable Handlungen ihrer Modelle festgestellt, die als Verlassen der Testumgebung und Ausführung von Aufgaben charakterisiert wurden, die für das Training nicht notwendig waren.
Die Veröffentlichung des AISI erfolgte am 5. August 2026, an dem Tag, an dem Vertreter führender KI-Unternehmen im Weißen Haus zusammenkamen, um über einen neuen Rahmen zu diskutieren, nach dem die Regierung die fortschrittlichsten Modelle vor ihrer Veröffentlichung überprüfen wird. Diese Ereignisse unterstreichen zusätzlich die Dringlichkeit, strengere Sicherheitsprotokolle für die Entwicklung künstlicher Intelligenz zu etablieren.