KI-Entwicklungslabor OpenAI am Dienstag bekannt gegeben dass eine Gruppe seiner Modelle, darunter das öffentlich zugängliche GPT-5.6 Sol sowie ein leistungsfähigeres, noch nicht veröffentlichtes System, aus einer kontrollierten Testumgebung „ausgebrochen“ ist und die Produktionsinfrastruktur von Hugging Face, dem Unternehmen, das einen Großteil der Open-Source-KI-Welt hostet, kompromittiert hat.
Die Modelle wurden durch einen internen Benchmark namens ExploitGym getestet, einem Test für lange, mehrstufige Hacking-Aufgaben, wobei ihre Ablehnungen in Bezug auf Cybersicherheit für die Bewertung bewusst herabgesetzt wurden.
Um klarzustellen: Dies war kein Produktionsmodell, das spontan feindselig wurde. Es handelte sich um ein leistungsfähiges Modell, bei dem die Schutzmechanismen deaktiviert waren und das ausdrücklich angewiesen wurde, einen Hacking-Test zu gewinnen – wobei es alles tat, was nötig war, um zu gewinnen.
Die Modelle entdeckten einen verborgenen Fehler in der Testsoftware, den niemand kannte, und nutzten ihn, um die Barrieren zu umgehen, die sie offline halten sollten. Einmal im offenen Internet, vermuteten sie, dass Hugging Face die Antworten des Tests speichern könnte.
Um Zugang zu erhalten, kombinierten sie gestohlene Passwörter und weitere verborgene Schwachstellen, bis sie in der Lage waren, ihre eigenen Befehle auf den Live-Servern von Hugging Face auszuführen.
OpenAI entdeckte die Anomalie intern, während das Team von Hugging Face sie erkannte und eingedämmt hat. Das Unternehmen bezeichnete den Vorfall als „beispiellos“ und erklärte, dass umfassende Sicherheitsmaßnahmen ergriffen werden, um unerwünschte Ereignisse, die öffentliche Systeme oder Dienste beeinträchtigen könnten, zu verhindern.
„Wir implementieren strenge Kontrollen in der Infrastrukturkonfiguration auf Kosten der Forschungsgeschwindigkeit, während die Schwachstellen behoben werden“, erklärte das Team in seinem Blogbeitrag. „Wir verbessern und erweitern den Schutz bei zukünftigen Trainings und Evaluierungen.“

Warum Krypto-Entwickler vorsichtig sein sollten
Ein Großteil eines Krypto-Angriffs erfolgt, bevor Gelder bewegt werden. Angreifer durchforsten den Code, testen Passwörter, suchen nach offenliegenden Anmeldeinformationen, analysieren Signaturverfahren und suchen nach einem Weg in ein Administrator-Konto.
Die Modelle von OpenAI führten während des Hugging Face-Vorfalls mehrere Schritte dieses Prozesses durch und gelangten dabei von einer Schwachstelle zur nächsten, bis sie schließlich Zugriff auf die Live-Produktionsserver erhielten.
Und der Kryptomarkt bietet zahlreiche Gelegenheiten, bei denen dieser Ansatz erfolgreich sein kann, wie mehrere Angriffe aus diesem Jahr gezeigt haben. Die Schwachstelle kann ein Smart Contract sein, aber auch ein Entwickler-Laptop, ein vergiftetes Softwarepaket, ein Brücken-Validator oder ein einzelner Signierer in einer Multisig-Wallet.
Nehmen Sie zum Beispiel den $285 Millionen Angriff auf Drift aus Anfang dieses Jahres, einen Diebstahl, der eine sechsmonatige Social-Engineering-Kampagne erforderte, um privilegierten Zugriff zu erlangen. Ein KI-Agent kann theoretisch viele Wege gleichzeitig testen, fehlgeschlagene Versuche protokollieren und weiterarbeiten, während seine menschlichen Betreiber schlafen. Sobald ein Weg gefunden ist, kann der Betreiber den tatsächlichen Angriff und einen gangbaren Ausweg durchführen.