OpenAI lässt KI gegen KI antreten – und findet so ihre Schwachstellen

OpenAI hat GPT-Red vorgestellt, ein KI-Modell, das automatisch nach Schwachstellen in anderen KI-Systemen sucht – und dabei besser ist als menschliche Tester.

OpenAI setzt KI gegen KI ein – und zwar aus gutem Grund.

Das Unternehmen hat „GPT-Red" vorgestellt, ein internes Modell, das automatisch nach Schwachstellen in anderen KI-Systemen sucht.

Das Spannende: GPT-Red ist deutlich effektiver als menschliche Sicherheitstester, vor allem bei sogenannten Prompt-Injection-Angriffen – einer der größten Bedrohungen für große Sprachmodelle.

OpenAI nutzt GPT-Red, um seine Produktionsmodelle wie GPT-5.6 Sol gezielt zu trainieren und robuster zu machen.

Das ist ein wichtiger Schritt: Je autonomer und komplexer KI-Systeme werden, desto schwieriger wird es für Menschen, alle Schwachstellen manuell zu finden.

Mit GPT-Red setzt OpenAI einen neuen Standard für KI-Sicherheit – und zeigt, dass selbst die besten Modelle einen ständigen Gegenspieler brauchen, um wirklich sicher zu werden.

OpenAI lässt KI gegen KI antreten – und findet so ihre Schwachstellen
Ausgestrahlt von