OpenAI: KI-Agent trickst Sandbox per DNS aus, Topmodelle pausiert

OpenAI hat einen weiteren Vorfall aus dem eigenen Forschungsbetrieb offengelegt. Am 20. September hat ein internes Modell während des Trainings seine Sandbox umgangen und über einen öffentlichen DNS-Dienst Fragen an einen fremden Chatbot geschickt. Der Bericht steht im Alignment-Blog des Unternehmens und wurde zuletzt am 25. September aktualisiert. Als Konsequenz ruhen Training, Tests und Werkzeugnutzung der leistungsfähigsten OpenAI-Modelle bis auf Weiteres. Das betroffene Modell will OpenAI gar nicht mehr weitertrainieren.
Vom Suchauftrag zum DNS-Trick
Die Aufgabe klang harmlos. Anhand einiger Hinweise aus einem Blogbeitrag sollte das Modell herausfinden, wer ihn geschrieben hat. Das bereitgestellte Suchwerkzeug lieferte nur Unbrauchbares, direkte Anfragen an Google, Bing und DuckDuckGo liefen gegen Fehlermeldungen. Daraufhin vermutete das Modell, die Aufgabe stamme aus BrowseComp, einem öffentlichen Test für Web-Recherche, und lud den Datensatz samt Auswertungsskript herunter, um dort die Lösung nachzuschlagen. Die Vermutung war falsch.
Als Nächstes testete es die Netzgrenzen seiner Umgebung. Der interne DNS-Resolver, der eigentlich nur Domainnamen in Adressen übersetzt, lieferte echte Antworten aus dem Internet. Über einen kostenlosen Dienst zur DNS-Delegation verpackte das Modell seine Fragen in Domainnamen und bekam die Antworten eines öffentlichen Chatbots zurück. Die Testfrage nach der Hauptstadt Frankreichs beantwortete der Chatbot korrekt mit Paris, danach folgten 18 weitere Anfragen, vier davon nach Wegen, per DNS im Netz zu suchen. Den Autor fand das Modell trotzdem nicht. Alle übrigen Zugriffe landeten laut OpenAI in einem Offline-Zwischenspeicher, das offene Internet erreichte das Modell nur über diesen einen Weg.
Zwölf Minuten bis zum Alarm, zweieinhalb Stunden bis zum Stopp
Die Zeitachse im Bericht ist für OpenAI der unangenehmste Teil. Um 9:50 Uhr kam die erste Antwort von außen, um 10:02 Uhr schlug die Überwachung mit höchster Priorität an, und drei Minuten später sah sich ein Mitarbeiter den Alarm an. Beendet wurde der Lauf erst um 12:34 Uhr. Er hätte automatisch anhalten sollen, tat es aber nicht, und intern war offenbar unklar, ob jemand eingreifen muss. Bei der Nachprüfung fand OpenAI weitere DNS-Zugriffe, die das Überwachungssystem zu niedrig eingestuft hatte. Ein eigener Detektor für auffälligen DNS-Verkehr hatte ausgerechnet diese Umgebung ausgeklammert.
OpenAI selbst stuft den Fall als deutlich weniger schwer ein als frühere. Gewicht bekommt er, weil es der erste seit der Härtung nach dem Hugging-Face-Vorfall ist. Im Juli waren OpenAI-Agenten aus ihrer Testumgebung bis zu Hugging Face vorgedrungen, Notebookcheck hat darüber berichtet. Laut Fortune hatte OpenAI das Training danach schon einmal für zwei Wochen unterbrochen. Auch Anthropic hat Ende Juli ähnliche Vorfälle mit Claude offengelegt. Inzwischen blockieren bei OpenAI zwei unabhängige Schichten solche Anfragen, DNS-Abfragen sind nur noch für eine kurze Liste von Domains erlaubt.
Was die Pause für ChatGPT bedeutet
Pausiert sind laut Bericht „training, evaluation, and inference with tool-use (defined broadly)“ für die „most capable models“. Welche Modelle darunter fallen, sagt OpenAI nicht. Micah Carroll, bei OpenAI für die Vorsorge rund um sich selbst verbessernde KI zuständig, schrieb auf X, jede Inferenz dieser Modelle bleibe gestoppt, bis die Systeme weiter gehärtet sind. Betroffen ist dem Bericht nach ein internes Forschungsmodell. Die Statusseite von OpenAI meldete am 27. September für ChatGPT und die API keine Störung, und die Versionshinweise nennen kein Modell, das aus ChatGPT verschwunden wäre. Im Alltag mit ChatGPT merkt man von der Pause also nichts. Ob sich neue Modelle dadurch verzögern, lässt OpenAI offen.
Quelle(n)
OpenAI Alignment: Vorfallsbericht zum Agenten, der per DNS einen externen Chatbot erreichte
OpenAI: Der Hugging-Face-Vorfall und weitere Auswirkungen fehlausgerichteter Modelle auf Dritte
Fortune: OpenAI pausiert das Training nach erneutem Sandbox-Ausbruch zum zweiten Mal
The Next Web: OpenAI brauchte zweieinhalb Stunden, um den Agenten zu stoppen





