Die OpenAI-Mitteilung im Wortlaut:
"Letzte Woche hat Hugging Face eine neuartige Art von Sicherheitsvorfall offengelegt(wird in einem neuen Fenster geöffnet), nachdem das Unternehmen einen KI-Agenten entdeckt und eingedämmt hatte, der seine Infrastruktur kompromittiert hatte. Wir gehen davon aus, dass solche Vorfälle mit der Verbreitung zunehmend cyberfähiger Modelle häufiger werden. Nach der Untersuchung wissen wir nun, dass dieser konkrete Vorfall durch eine Kombination von OpenAI-Modellen ausgelöst wurde, darunter GPT‑5.6 Sol und ein noch leistungsfähigeres Pre-Release-Modell. Bei allen waren die Ablehnungen von Cyber-Anfragen zu Evaluationszwecken reduziert, während sie intern anhand eines Benchmarks(wird in einem neuen Fenster geöffnet) für Cyber-Fähigkeiten getestet wurden.
Wir betrachten dies als beispiellosen Cybervorfall mit hochentwickelten Cyber-Fähigkeiten und reagieren entsprechend. Wir teilen zu diesem Zeitpunkt vorläufige Erkenntnisse, damit Sicherheitsverantwortliche nachvollziehen können, was passiert ist, und besser einschätzen können, wozu Modelle inzwischen in der Lage sind. Wir werden die Untersuchung gemeinsam mit Hugging Face gründlich fortsetzen und weitere Details zu den Schwachstellen, dem Vorfall und den Erkenntnissen veröffentlichen, sobald unsere Untersuchung abgeschlossen ist.
Dieser Vorfall ereignete sich während einer internen Evaluation, bei der Modelle angewiesen werden, komplexe Angriffswege für fortgeschrittene Exploitation zu verfolgen, um ihre Cyber-Fähigkeiten zu quantifizieren. Wir schätzen maximale Cyber-Fähigkeiten, indem wir diese Evaluation ohne Produktionsklassifikatoren durchführen, die Modelle daran hindern sollen, risikoreiche Cyberaktivitäten zu verfolgen. Unsere Benchmarks laufen in einer stark isolierten Umgebung. Der Netzwerkzugriff ist darauf beschränkt, Pakete über eine intern gehostete Drittanbietersoftware zu installieren, die als Proxy und Cache für Paket-Registries dient.
Wir verbessern die Schutzmaßnahmen für künftige Trainingsläufe und Evaluationen und ergänzen sie um stärkere Sicherheitsvorkehrungen. Diese Woche haben wir einen Blogbeitrag darüber veröffentlicht, wie sich Sicherheit und Alignment in einer Ära von Modellen mit langem Zeithorizont verbessern lassen. Diese Schutzmaßnahmen für den Einsatz waren während dieser Evaluation bewusst nicht aktiviert, weil sie auf das Testen von Cyber-Schwachstellen ausgerichtet war. Der Vorfall zeigt, dass wir das Alignment unseres Modells, den Cyberschutz während Evaluationen und das Monitoring bei internen Tests weiter stärken müssen.
Ende des Wortlauts
Experten, mit denen World News Monitor gesprochen hat, halten die Nummer für eine Marketing-Aktion. Investoren solle so vor Augen geführt werden, warum die bisher schon exorbitanten Investments weitere, exorbitante Investments erforderlich machen.
Als Hinweis für diese These können die letzten beiden Absätze der Mitteilung von OpenAI genommen werden. Hier heißt es zu den Konsequenzen aus dem Vorfall, dass die Systeme noch komplexer - und damit teurer - werden müssen.
OpenAI schreibt:
"Der Vorfall macht außerdem deutlich, dass fortgeschrittene Modelle ohne Zugriff auf den Quellcode neue Angriffswege in realen Systemen entdecken und ausnutzen können. Er zeigt, dass fortgeschrittene Cyber-Fähigkeiten zusammen mit stärkeren Schutzmaßnahmen und Abwehrwerkzeugen entwickelt werden müssen.
Wir sind überzeugt, dass Modelle mit fortgeschrittenen Cyber-Fähigkeiten Sicherheitsteams dabei helfen müssen, Schwachstellen vor Angreifenden zu finden, Verkettungen von Schwachstellen zu verstehen und sie in Maschinengeschwindigkeit zu beheben. Wir nutzen diese Fähigkeiten, um den Schutz rund um Infrastrukturkonfigurationen und Umgebungen für Modellevaluationen weiter zu stärken. Unsere Erkenntnisse und bewährten Verfahren teilen wir, sobald wir dazulernen. Wir ermutigen andere Sicherheitsverantwortliche, sich für Trusted Access zu bewerben und jetzt mit diesen Modellen zu experimentieren, damit diese Fähigkeiten in bessere Prävention, schnellere Erkennung und wirksamere Incident Response einfließen."
