OpenAI bremst Astra – KI-Modell zu gut im Hacken
OpenAI bremst sein neuestes Modell – weil es zu gut hacken kann.
Das unveröffentlichte KI-Modell „Astra" hat in internen Tests gezeigt, dass es eigenständig Schwachstellen findet und Cyberangriffe ausführen kann.
So gut, dass OpenAI die Arbeit daran verlangsamt hat.
Das Modell erreichte die höchste Risikostufe im hauseigenen Sicherheits-Framework – „Critical".
OpenAI reagiert jetzt mit verschärften Kontrollen und isolierten Testumgebungen.
Das ist mehr als nur eine technische Hürde: Es zeigt, dass selbst die führenden KI-Labs mit den Fähigkeiten ihrer eigenen Modelle kämpfen.
Aus Sicherheitsprüfungen wird kein Papierkram mehr, sondern ein echter Release-Hebel.
Die Frage ist nicht mehr ob, sondern wann solche Modelle ausbüxen könnten – und was dann passiert.
