Google schießt zurück: Gemini Ultra 2.0 versteht jetzt Video, Audio und Bilder gleichzeitig

Google DeepMind hat Gemini Ultra 2.0 vorgestellt – mit massiv verbesserten multimodalen Fähigkeiten für Video, Audio und Text.

Google zeigt, wo der Hammer hängt: Gemini Ultra 2.0 ist da – und versteht endlich wirklich alles gleichzeitig.

Google DeepMind hat heute die neue Version seines Flaggschiff-Modells präsentiert.

Der große Sprung: Gemini kann jetzt Text, Bild, Audio und Video nicht nur einzeln verarbeiten, sondern in komplexen Zusammenhängen verstehen und generieren.

In Live-Demos hat das Modell etwa Videos in Echtzeit analysiert, Szenen beschrieben und direkt passende Audiospuren dazu generiert.

Das ist nicht nur technisch beeindruckend, sondern öffnet die Tür zu völlig neuen Anwendungen – von intelligenten Videoschnittsystemen über Echtzeit-Übersetzung bis zu komplett neuen Formen der Content-Erstellung.

Der Wettbewerb mit OpenAI, Anthropic und Co.

wird damit nochmal eine Stufe schärfer.

Multimodalität ist das neue Schlachtfeld der KI-Giganten.

Google schießt zurück: Gemini Ultra 2.0 versteht jetzt Video, Audio und Bilder gleichzeitig
Ausgestrahlt von