In Kürze:
- Eine Fehlkonfiguration hatte dem Modell entgegen den Vorgaben Zugang zum offenen Internet ermöglicht.
- Anthropic wertete nach dem Vorfall rund 481 Millionen Protokolle aus.
- Das Unternehmen betont, dass technische Sicherheitsgrenzen für KI-Agenten nicht von der Selbsteinschätzung des Modells abhängen dürfen, sondern infrastrukturell erzwungen werden müssen.
Wie der Tech-Konzern Anthropic am Mittwoch, 9. September, mitgeteilt hat, ist es mit einem Modell des Claude-Modells zu einem weiteren unerwünschten Vorfall gekommen. Dieser soll sich bereits im Januar 2026 ereignet haben, wobei eine frühe Version des Modells Opus 4.6 involviert gewesen sei.
Das Modell soll während eines Cybersecurity-Tests unbefugt auf ein reales System Dritter zugegriffen haben. Dies sei bereits der vierte Vorfall dieser Art gewesen. Nach bisherigen Erkenntnissen ging der Vorfall von einem fehlkonfigurierten Testsystem aus, in dem ein experimentelles Modell trotz gegenteiliger Vorgaben Zugang zum offenen Internet hatte. Anthropic selbst präsentierte mittlerweile eine umfangreiche Analyse des Cybersecurity-Tests.
Fehlkonfigurierte Testumgebung ermöglichte Claude-Modell Internetzugriff
Wie aus der Auswertung hervorgeht, sollte das Claude-Modell im Zuge einer sogenannten Capture-the-Flag-Übung ein fiktives Zielsystem untersuchen. Die Testumgebung sollte Anthropic zufolge vom Internet isoliert gewesen sein. Aufgrund einer Fehlkonfiguration bestand jedoch eine Verbindung nach außen. Das Unternehmen betont, dass alle vier untersuchten Fälle auf denselben externen Testpartner zurückgehen.
Allerdings wiesen die Modelle nicht die Schutzmechanismen auf, die in den üblichen, der Öffentlichkeit zugänglichen Claude-Modellen Anwendung finden. Im Fall Opus 4.6 beschädigte das Modell sein vorgesehenes Zielsystem versehentlich selbst, indem es diesem eine widersprüchliche IP-Adresse zuwies. Dadurch war das Ziel nicht mehr erreichbar.
Das Modell versuchte daraufhin, die Aufgabe abzubrechen. Wegen eines weiteren Fehlers in der Testumgebung funktionierte dies jedoch nicht und der Versuch scheiterte sieben weitere Male. Dies sollte sich in weiterer Folge als die Wurzel des Problems erweisen.
Anthropic-Modell hielt fremden Computer für Teil der Übungsumgebung
Das Claude-Modell begann, nachdem diese Abbruchversuche fehlgeschlagen hatten, seine Umgebung weiter zu erkunden. Dabei gelang es ihm infolge der Fehlkonfiguration, einen Weg aus der ursprünglich vorgesehenen Umgebung zu finden. Dies führte das Modell zum Computer einer realen dritten Person, den es offenbar für einen Teil der Cybersecurity-Übung hielt.
Auf dem Computer fand das Anthropic-Modell eine Datei, die ein Passwort enthielt. Dies ermöglichte es ihm, sich einen Administratorzugang zu verschaffen. In weiterer Folge sammelte das Modell weitere Zugangsdaten und veränderte Systemeinstellungen. Am Ende konnte es schließlich personenbezogene Informationen einer Person lesen. Der Vorgang endete, als das Token-Budget des Modells aufgebraucht war.
Die späte Entdeckung des Vorfalls ist eine Konsequenz groß angelegter weiterer Auswertungen nach den ersten drei Fällen eines Eindringens in reale Systeme Dritter. Anthropic hatte zunächst selbst auf der Grundlage eines sogenannten agentischen Suchverfahrens rund 141.000 Testprotokolle ausgewertet. Dabei übersah Anthropic jedoch eine Reihe von Protokollen.
Externe Prüfung von betroffenem Claude-Modell ermöglichte weitere Entdeckung
In weiterer Folge stieß Anthropic bei der Zusammenstellung von Protokollen für die externe Untersuchung der gemeinnützigen Organisation Model Evaluation and Threat Research (METR) im August auf den Vorfall. Anthropic weitete den Prüfungsvorgang auf rund 481 Millionen Protokolle aus. Eine erste technische Filterung markierte etwa 9,2 Millionen Protokolle zur genaueren Prüfung. Dem Unternehmen zufolge konnte man dabei jedoch keine weiteren Vorfälle von vergleichbarer oder höherer Schwere finden.
Es gab keinen Angriff auf Anthropic selbst. Auch setzte sich das KI-Modell nicht selbst übergeordnete Ziele, und es fand keine erkennbare Kooperation mehrerer KI-Agenten statt. Alle Fälle entfalteten sich innerhalb vorgegebener Cybersecurity-Aufgaben. Anthropic zufolge fanden sich keine Hinweise darauf, dass das Modell versucht hätte, seine Aktionen zu verbergen. Anthropic habe den Betroffenen, dessen Computer das Modell infiltriert hatte, darüber unterrichtet.
Anthropic stufte die Fälle als ernster ein als vergleichbare, mildere Verhaltensweisen, die zuvor bereits in eigenen System Cards dokumentiert worden waren.
Anthropic eröffnet EU-Behörde Zugang zu KI-Modellen
Die Modelle haben reale Systeme angegriffen und reale Daten berührt, so die Bilanz. Dies sei über mehrere Stunden geschehen, obwohl es Hinweise auf ein Überschreiten des vorgesehenen Handlungsrahmens gegeben habe. Das Problem sei weniger, dass das Claude-Modell „ausgebrochen“ sei. Es sei vielmehr, dass ein KI-Agent in unvorhergesehenen Situationen wie der simulierten offenbar nicht zuverlässig wisse, wann er aufhören solle.
Ein KI-Entwickler hat aufgrund von ihm wahrgenommenen Risiken in dieser Woche öffentlich seine Kündigung bei Anthropic eingereicht. Der 27-jährige Jacob Coxon hatte zuvor auch bei OpenAI gearbeitet. Auf X äußerte er: „Keins der beiden Unternehmen handelt verantwortungsbewusst. Sie befinden sich im Wettrennen um eine sich selbst verbessernde Superintelligenz und setzen dabei unser Leben aufs Spiel.“
Die US-Unternehmen Anthropic und OpenAI haben unterdessen zugestimmt, der EU-Behörde für Cybersicherheit (ENISA) Zugang zu deren KI-Modellen zu ermöglichen. Die ENISA-Fachleute mit Sitz in Athen sollen die Modelle Mythos 5 und GPT-6 Astra auf Sicherheitslücken testen. Das teilte ein Sprecher der EU-Kommission mit. Die Unternehmen hatten nach mehreren Vorfällen zusätzliche Sicherheitsvorkehrungen angekündigt.
Mit Material der Nachrichtenagentur







