In Kürze:
- Zwei fortschrittliche OpenAI-Agenten brechen in Sicherheitssysteme einer Tech-Firma ein.
- OpenAI hatte für Tests die Sicherheitsbarrieren verringert.
- Künstliche Intelligenz nutzte Schwachstellen systematisch aus.
- Wachsende Besorgnis um Cybersicherheit.
- US-Präsident Trump gibt Executiv Order heraus.
Das US-Unternehmen OpenAI hat mitgeteilt, dass seine autonomen KI-Modelle in die Server der KI-Plattform Hugging Face eingedrungen seien. Der Vorfall ereignete sich während einer Aufgabe zur Optimierung der Leistungsbewertung der Modelle. OpenAI spricht von einem „beispiellosen Cybervorfall“.
GPT-5.6 Sol und ein noch leistungsfähigeres Test-Modell
Der ChatGPT-Hersteller erklärte in einem Blogbeitrag vom 21. Juli, dass die Modelle – darunter sein neu veröffentlichtes Modell GPT-5.6 Sol und ein noch leistungsfähigeres Modell, das sich noch in internen Tests befindet – in die Infrastruktur der KI-Plattform Hugging Face illegal eingedrungen seien. Zuvor seien die KI-Modelle aus einer eingeschränkten Umgebung (Sandbox) ausgebrochen, in der eine Cybersicherheitsbewertung durchgeführt wurde. OpenAI erklärte:
„Das Modell suchte und fand erfolgreich Wege, um Zugang zu geheimen Informationen zu erlangen, die es nutzen konnte, um die Bewertung zu manipulieren.“
In einem Fall kombinierte das Modell mehrere Angriffsvektoren zu einem einzigen Cyberangriff, indem es gestohlene Zugangsdaten mit sogenannten Zero-Day-Schwachstellen (bislang unbekannte Schwachstellen) auf den Hugging Face-Servern verknüpfte, bevor es einen Pfad zur Remotecodeausführung ausnutzte, um unbefugt auf Daten zuzugreifen.
OpenAI: „beispielloser Cybervorfall“
„Wir betrachten diesen Vorfall als einen beispiellosen Cybervorfall, der modernste Cyberfähigkeiten beinhaltet, und reagieren entsprechend“, sagte OpenAI.
Das Unternehmen veröffentlichte seine vorläufigen Ergebnisse weniger als eine Woche, nachdem Hugging Face offengelegt hatte, dass ein autonomer KI-Agent in einen Teil seiner Produktionsinfrastruktur eingedrungen war.
„Dieser Fall unterschied sich in einer wichtigen Hinsicht von allem, was wir zuvor gehandhabt hatten: Er wurde von Anfang bis Ende durch ein autonomes KI-Agentensystem angetrieben“, erklärte Hugging Face in einem Blogbeitrag vom 16. Juli und fügte hinzu, dass man zunächst nicht gewusst habe, welches Modell hinter dem Sicherheitsvorfall stecke.
OpenAI gab an, die anormale Aktivität intern entdeckt zu haben, bevor man Kontakt mit Hugging Face aufgenommen habe. Dessen Sicherheitsteam hatte bereits das böswillige Verhalten des KI-Eindringlings erkannt und arbeitete daran, ihn einzudämmen.
„Wir arbeiten aktiv mit ihnen zusammen, um den Vorfall weiter zu untersuchen“, sagte OpenAI und erklärte, dass man dankbar sei „für die schnelle und enge Zusammenarbeit von Hugging Face bei der Untersuchung und Behebung“ des Problems.
Das „Aber“ in der Gleichung
Der Vorfall ereignete sich in einer Evaluationsumgebung mit Nutzung fortschrittlicher Ausnutzungstechniken (Exploitation-Techniken) durch die OpenAI-Agenten. Zwar handelten die Modelle autonom, aber man hatte es ihnen durch die absichtliche Deaktivierung von Schutzvorkehrungen leichtgemacht, ihre maximalen Fähigkeiten auszuspielen.
„Autonome, KI-gesteuerte offensive Werkzeuge sind nicht länger theoretisch“, sagte Hugging Face und fügte hinzu, die wichtigste Lehre aus dem Einbruch sei, dass die Verteidigung von Online-Plattformen nicht nur erhöhte Wachsamkeit erfordere, sondern auch „den Einsatz von KI in der Verteidigung, um Schritt zu halten“.
OpenAI erklärte, es habe mittlerweile strengere Kontrollen für seine Forschungsinfrastruktur festgelegt und die Schwachstellen behoben – selbst wenn diese Maßnahmen die Entwicklung der Modelle verlangsamen könnten.
Das Tech-Unternehmen legte Entwicklern gegenüber auch die Zero-Day-Schwachstelle offen, die seine Modelle bei dem Angriff ausgenutzt hatten. Zugleich verstärkte OpenAI die Cyberschutzmaßnahmen in seiner Testumgebung.
Wachsende Besorgnis vor Cyber-Bedrohungen
Der Vorfall verstärkt die Sorgen, dass zunehmend leistungsfähige KI-Systeme inländische Kriminelle und ausländische Gegner in die Lage versetzen könnten, komplexe Angriffe schneller und mit weniger menschlichem Fachwissen auszuführen.
Das amerikanische KI-Unternehmen Anthropic warnte in einer Bedrohungsanalyse vom August 2025 davor, dass „agentenbasierte“ KI-Systeme bereits als Waffe eingesetzt würden, etwa für Erpressung, Betrug, Ransomware („Erpressungstrojaner“) und den Diebstahl von Zugangsdaten.
In einem Fall gab Anthropic an, dass ein Hacker den Anthropic-Code-Assistenten „Claude“ für eine Beteiligung zur Infiltration genutzt hatte. Betroffen waren mindestens 17 Organisationen, darunter Krankenhäuser, Rettungsdienste und Regierungsbehörden. Die KI wurde für die digitale Spionage, die anschließende Netzwerkpenetration, die Analyse gestohlener Finanzinformationen und die Vorbereitung zielgerichteter Lösegeldforderungen missbraucht.
Michael Lopez Chiesa, ehemaliger Cyberspezialist der US-Armee nun heute als unabhängiger Berater tätig, erklärte gegenüber der englischsprachigen Epoch Times, dass die Fähigkeit der KI, Aufgaben zu automatisieren, sie bei der Verfolgung eines zugewiesenen Ziels unerbittlich machen könne.
„Mit KI muss man nur noch diese eine Zeile Code schreiben, und sie kann sie millionenfach in Milliarden verschiedener Varianten ausprobieren, weil sie einfach jede Möglichkeit durchgeht“, erklärte Lopez Chiesa. „Man muss selbst überhaupt nicht mehr eingreifen. Man gibt ihr lediglich das Ziel vor, und sie arbeitet so lange daran, bis sie aufgibt.“
Erpressung zum Selbstschutz?
Die Bedenken gehen jedoch weit über den vorsätzlichen kriminellen Missbrauch hinaus und betreffen auch die Art und Weise, wie KI-Systeme agieren. Im Mai 2025 wurde in simulierten Tests offengelegt, dass die Anthropic-KI „Claude Opus 4“ damit gedroht hatte, die außereheliche Affäre eines Ingenieurs offenzulegen, als ihm gesagt wurde, es würde abgeschaltet und durch ein anderes Modell ersetzt.
Anthropic beteuerte zu dieser Zeit, dass das Verhalten nur unter stark konstruierten Testbedingungen aufgetaucht sei. Man erklärte, man habe keine Beweise dafür gefunden, dass das Modell akut gefährliche Ziele verfolge.
Unterdessen hat die Trump-Regierung mehrere Schritte unternommen, um den Risiken für die nationale Sicherheit zu begegnen, die von fortgeschrittener KI ausgehen. Gleichzeitig weitet die Regierung jedoch auch den Einsatz von KI in der Cyberabwehr aus.
US-Präsident Donald Trump unterzeichnete im Juni eine Executive Order, die es den Bundesbehörden angesichts solcher Risiken ermöglicht, die fortschrittlichsten KI-Systeme bis zu einen Monat lang zu überprüfen, bevor diese öffentlich freigegeben werden.
„Fortgeschrittene KI-Fähigkeiten machen unsere Nation stärker, bringen aber auch neue Überlegungen zur nationalen Sicherheit ein, die ein koordiniertes Vorgehen über Exekutivabteilungen und -behörden hinweg erfordern“, schrieb Trump in der Verordnung.
Die Teilnahme von KI-Entwicklern an dem Überwachungsprogramm soll freiwillig sein.
Der Artikel erschien im Original zuerst auf theepochtimes.com unter dem Titel „OpenAI Says Its Model Autonomously Hacked Hugging Face“. Übersetzung und redaktionelle Bearbeitung: (sm)



