Gemini, Live

Gemini 3.8 Live Avatar: Google gibt Echtzeit-Videogespräche für Firmen frei

Veröffentlicht am: 27.09.2026 um 02:33 Uhr | Redaktion boerse-global.de

Googles Cloud-Angebot verbindet mehrsprachige Echtzeitdialoge mit visuellen Avataren und ist in den USA sowie der EU verfügbar.

Google bringt Gemini 3.8 Live mit Avataren für Unternehmen heraus
Moderne Serverinfrastruktur in einem klimatisierten Rechenzentrum mit blauer Beleuchtung. Illustration mit AI erstellt.

Google hat am 24. September 2026 das Modell Gemini 3.8 Live with Live Avatar offiziell freigegeben. Das System ist ab sofort im Rahmen von Gemini Enterprise für Endpunkte in den USA und der Europäischen Union allgemein verfügbar. Die Technologie verbindet Echtzeit-Videogenerierung mit dialogfähigen Sprachmodellen, garantiert bereitgestellten Durchsatz und entspricht den üblichen Compliance-Vorgaben für Großkunden.

Multimodale Dialoge und synchrone Sprachverarbeitung

Vorgestellt wurde die Neuerung am 24. September 2026 auf der Konferenz Google Cloud Next 2026. Das System baut technisch auf dem Gemini-3.8-Live-Start der Vorwoche auf und ergänzt diesen um visuelle Interaktionsfiguren.

Zu den ersten praktischen Anwendern zählen Cox Automotive, das die Technologie für Fahrzeugempfehlungen in natürlicher Sprache auf Autotrader testet, sowie Salesforce im Zusammenspiel mit Agentforce. Zudem setzt das in Indien ansässige Unternehmen Equal AI das System bereits für über eine Million Live-Anrufe pro Tag in neun indischen Sprachen ein.

Die visuelle Komponente basiert auf einer nativen mehrsprachigen Verarbeitung, die Lippenbewegungen und Mimik synchron zu gesprochenen Inhalten darstellt.

Anzeige

Die rasante Entwicklung von KI-Systemen wie Gemini 3.8 stellt Unternehmen vor komplexe regulatorische Herausforderungen. Dieser kostenlose Umsetzungsleitfaden bietet Ihnen einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der aktuellen EU-Gesetzgebung. EU AI Act in 5 Schritten verstehen

Laut Google unterstützt die Plattform 97 Sprachen ohne sichtbare Brüche oder Verzögerungen beim Wechsel zwischen Sprachräumen. Visuelle und akustische Datenströme, darunter Sprache, Mimik und Bildinformationen, verarbeitet das System simultan in beide Richtungen.

In Leistungsvergleichen übertraf die Modellvariante Gemini 3.8 Live Extended Thinking die Konkurrenzsysteme GPT-Live-1 Astra sowie Grok Voice Think Fast 2.0 in mehreren Benchmarks, während die laufenden Kosten pro Stunde an eingehendem Audiomaterial niedriger ausfielen.

Asynchrone Datenabfragen und Sicherheitsmerkmale

Ein zentrales technisches Merkmal bildet das asynchrone Aufrufen von Werkzeugen. Schnittstellenabfragen und Datenbankzugriffe im Backend können parallel weiterlaufen, während der Avatar den Dialog mit dem Nutzer ohne störende Sprechpausen aufrechterhält. Als Praxisbeispiel verweist das Unternehmen auf Vorgänge wie den automatisierten Hotel-Check-in.

Fabien Blanc-paques, Gruppenproduktmanager für Gemini Live bei Google Cloud, unterstrich in diesem Kontext, dass die asynchrone Verarbeitung unnatürliche Gesprächspausen wirksam verhindere. Laut den beteiligten Entwicklern Shuo-yiin Chang und CJ Zheng erhalte künstliche Intelligenz damit eine greifbare visuelle Präsenz.

Anzeige

Während neue Technologien die Effizienz steigern, warnen Compliance-Experten vor den rechtlichen Risiken bei der Implementierung von KI-Systemen. Sichern Sie sich jetzt den kostenlosen Report mit allen relevanten Übergangsfristen, um empfindliche Strafen proaktiv zu vermeiden. Kostenlosen Umsetzungsleitfaden zum EU AI Act herunterladen

Unternehmen können auf vordefinierte Avatare zurückgreifen oder benutzerdefinierte Modelle anhand hochauflösender Vorlagen erstellen, um ein spezifisches Markendesign abzubilden.

Aus Sicherheitsgründen erfordern solche individuellen Avatare die Aufnahme in eine geprüfte Zulassungsliste sowie ein gesondertes Freigabeverfahren. Um Täuschungen vorzubeugen, wird jedes generierte Audio- und Videosignal mit einem digitalen SynthID-Wasserzeichen versehen.

Wachsender Markt für interaktive Bildschirmassistenten

Google adressiert mit dem Angebot Geschäftsbereiche wie den Kundendienst, digitale Empfangsschalter, Mitarbeiterschulungen und virtuelle Verkaufsassistenten. Die Dokumentation der Programmierschnittstelle wurde zeitgleich zugänglich gemacht.

Der Vorstoß fällt in eine Phase intensiver Bewegung im Segment der Unternehmensassistenten. Ebenfalls am 24. September 2026 kündigte Meta im Rahmen der Entwicklerkonferenz Connect 2026 echtzeitfähige Videochats mit anpassbaren Avataren an.

Parallel dazu meldete der Spezialist D-ID die Verfügbarkeit seines Modells Expressive V4 für Trainingsplattformen, während der Branchenanbieter Synthesia sein Angebot um interaktive Rollenspiele für Weiterbildungen erweitert hat. Google setzt demgegenüber vor allem auf die Kombination aus tiefer Backend-Integration, standardisierter Cloud-Infrastruktur und mehrsprachiger Echtzeitverarbeitung.

Disclaimer...

de | wissenschaft | 70187181 |