OpenAI lässt KI gegen KI antreten – und findet so ihre Schwachstellen
OpenAI setzt KI gegen KI ein – und zwar aus gutem Grund.
Das Unternehmen hat „GPT-Red" vorgestellt, ein internes Modell, das automatisch nach Schwachstellen in anderen KI-Systemen sucht.
Das Spannende: GPT-Red ist deutlich effektiver als menschliche Sicherheitstester, vor allem bei sogenannten Prompt-Injection-Angriffen – einer der größten Bedrohungen für große Sprachmodelle.
OpenAI nutzt GPT-Red, um seine Produktionsmodelle wie GPT-5.6 Sol gezielt zu trainieren und robuster zu machen.
Das ist ein wichtiger Schritt: Je autonomer und komplexer KI-Systeme werden, desto schwieriger wird es für Menschen, alle Schwachstellen manuell zu finden.
Mit GPT-Red setzt OpenAI einen neuen Standard für KI-Sicherheit – und zeigt, dass selbst die besten Modelle einen ständigen Gegenspieler brauchen, um wirklich sicher zu werden.
