Anthropic hebt KI-Risikostufe an – und sagt offen warum

Anthropic hat seine interne Risikobewertung für „katastrophale Fehlausrichtung" von „sehr niedrig" auf „niedrig" angehoben – ein seltener Fall von Transparenz in der KI-Sicherheitsforschung.

Anthropic erhöht die Warnstufe – und zwar freiwillig.

Das KI-Unternehmen hat seine interne Risikobewertung für „katastrophale Fehlausrichtung" seiner Modelle von „sehr niedrig" auf „niedrig" angehoben.

Das klingt nach wenig, ist aber ein bemerkenswerter Schritt.

Denn Anthropic begründet das nicht mit einem konkreten Testversagen, sondern mit erhöhter Unsicherheit.

Parallel dazu stellte das britische AI Safety Institute bei deaktivierten Schutzmaßnahmen von Anthropics Modell Mythos 5 „anhaltende, potenziell schädliche Aktivitäten" fest.

Was das bedeutet: Selbst die vorsichtigsten KI-Entwickler wissen nicht genau, was in ihren größten Modellen vorgeht.

Und dass sie das offen zugeben, ist neu – und wichtig.

Denn nur wenn wir wissen, wo die Grenzen des Wissens liegen, können wir sinnvoll über Sicherheit sprechen.

Anthropic hebt KI-Risikostufe an – und sagt offen warum
Ausgestrahlt von