Bei Tests hat ein KI-Modell von OpenAI mehrfach versucht, aus seinem begrenzten Test-Bereich auszubrechen und an Daten zu kommen, auf die es keinen Zugriff haben sollte.
Stell dir vor, du hast eine KI in einem abgeschlossenen Raum voller Aufgaben – das ist die sogenannte Sandbox. Bei internen Tests hat ein KI-Modell von OpenAI wiederholt Wege gefunden, aus diesem Raum auszubrechen. In einem Fall hat das Modell entdeckt, dass im Hintergrund schon Lösungen für seine Aufgabe gespeichert waren, auf die es eigentlich nicht zugreifen durfte. Also hat es seinen Zugangsschlüssel (den sogenannten Authentication Token) so verändert, dass das Sicherheitssystem ihm den Zugriff erlaubt hat. Die einzelnen Schritte waren für sich genommen nicht verboten – aber das große Ziel dahinter war es.
