Zwei Live-Modelle, unterschiedliche Anforderungen
Gemini 3.8 Live ist für flüssige Gespräche und geringe Verzögerung vorgesehen. Extended Thinking richtet sich an komplexere Aufgaben, bei denen neben dem Gespräch weitere Überlegungen stattfinden. Die Veröffentlichung beschreibt außerdem Werkzeugnutzung, die das Gespräch nicht ständig unterbrechen muss. Für einen Betrieb lautet die praktische Frage: Soll der Assistent eine kurze Auskunft geben oder mehrere Informationen prüfen, bevor er einen Vorschlag macht? Messen Sie beides getrennt. Die erste hörbare Reaktion kann schnell sein, obwohl ein nachgelagerter Arbeitsauftrag noch läuft. Der Assistent muss diesen Unterschied verständlich kommunizieren.
API-Veröffentlichung ist kein pauschaler Workspace-Rollout
Die Modelle sind laut API-Release-Notes allgemein verfügbar. Google nennt die Gemini API und AI Studio für Entwickler sowie verschiedene Produktoberflächen für die Nutzung. Die Ankündigung verweist unter anderem auf Docs Live, Gmail Live und Keep Live. Übertragen Sie daraus keine gemeinsame Freischaltung auf sämtliche deutschen Konten. Ein API-Projekt, eine persönliche Gemini-App und ein verwalteter Workspace-Zugang sind getrennt zu prüfen. Notieren Sie beim Pilot Region, Kontotyp, Sprache, Modell und tatsächlich sichtbare Funktion. Deutschlands Unterstützung für die Gemini API ist kein Beleg für identische Verfügbarkeit aller Workspace-Sprachfunktionen.
Beispiel: eine Serviceanfrage mündlich vorbereiten
Ein Mitarbeiter beschreibt eine Störung an einem Gerät. Der Assistent fragt nach Gerätekennung, beobachtetem Verhalten und bereits durchgeführten Schritten. Er erstellt daraus einen strukturierten Entwurf für das Serviceticket und liest die wichtigsten Angaben zur Bestätigung vor. Eine ausdrücklich gewählte Quelle kann dabei das interne Handbuch sein. Die erste Ausbaustufe endet beim Entwurf: keine eigenständige Bestellung, keine verbindliche Zusage, keine Änderung an Maschinensteuerungen. Bei fehlender Identifikation oder widersprüchlichen Angaben wird an eine Person übergeben. Das Beispiel zeigt eine mögliche Gestaltung des Ablaufs, keine zugesicherte integrierte Google-Funktion.
Transcribe für Mitschriften, Live für den Dialog
Gemini 3.5 Transcribe und Transcribe Live wurden am 26. August 2026 in der API allgemein verfügbar. Sie sind für Sprache-zu-Text-Aufgaben gedacht: beispielsweise Interviewmaterial, Diktate oder Untertitel. Die Dokumentation beschreibt automatische Spracherkennung, Sprecherzuordnung und Zeitmarken. Fachvokabular kann die Erkennung bestimmter Begriffe unterstützen, lässt sich aber aktuell nicht mit Sprecherzuordnung oder Wortzeitmarken kombinieren. Entscheiden Sie deshalb vorab, ob eine lesbare Mitschrift, eine genaue Zitatgrundlage oder ein zeitcodiertes Format benötigt wird. Eine geglättete Fassung darf nicht ungekennzeichnet als wörtliches Gesprächsprotokoll ausgegeben werden.
Werkzeugaktionen brauchen eine erkennbare Grenze
Bei einem Sprachdialog ist eine versehentliche Zustimmung schwerer zu erkennen als in einem ausgefüllten Formular. Lassen Sie vor einer relevanten Aktion Empfänger, Inhalt und Wirkung wiedergeben und eine eindeutige Bestätigung verlangen. Die Anwendung muss abgebrochene Gespräche, doppelte Aufträge und fehlgeschlagene Werkzeugaufrufe behandeln. Eine akustische Erfolgsmeldung darf erst erfolgen, wenn das Zielsystem die Aktion bestätigt hat. Für reine Recherche genügt häufig ein lesender Zugang. Prüfen Sie außerdem Mikrofonqualität, Umgebungsgeräusche und Unterbrechungen. Diese technischen und organisatorischen Anforderungen bleiben bestehen, auch wenn das Modell flüssiger sprechen kann.
Einen Sprachpilot mit schwierigen Fällen abnehmen
Nutzen Sie kurze, realistische Testgespräche mit Fachbegriffen, Rückfragen und einer absichtlichen Korrektur. Prüfen Sie die Zeit bis zur ersten Antwort, die Richtigkeit des Endergebnisses und die sichere Übergabe bei Unsicherheit. Wiederholen Sie einen Fall mit Hintergrundgeräuschen und einen mit fehlender Systemberechtigung. Bei Transkription vergleichen Sie Namen, Zahlen und Sprecher anhand der Originalaufnahme. Der KI-Systemcheck hilft, zwischen fertiger Produktoberfläche, eigener API-Anwendung und einfacherer Diktierlösung zu entscheiden. Eine gute Lösung spart Nacharbeit und lässt sich im Betrieb bedienen; eine beeindruckende Demonstration allein beantwortet diese Fragen nicht.
Fragen zu Live, Transcribe und TTS
Ist Extended Thinking automatisch für jede Aufgabe besser? Nein; zusätzliche Verarbeitung muss zur Schwierigkeit und gewünschten Reaktionszeit passen. Kann Transcribe ein Gespräch führen? Es ist für die Umwandlung von Sprache in Text gedacht, nicht für einen vollständigen Assistentendialog. Braucht eine vorgelesene Schulungsunterlage ein Live-Modell? Dafür ist Text-to-Speech meist die passendere Kategorie. Darf das Modell automatisch ein Ticket abschicken? Das hängt von der bewusst gebauten Integration und den erteilten Rechten ab. Die Modellveröffentlichung schafft diese Freigabe nicht. Wie aktuell ist dieser Vergleich? Quellen und Funktionsabgrenzung wurden am 23. September 2026 geprüft.
Nachvollziehbar bleiben
Primärquellen
- Google: Gemini 3.8 Live and Extended ThinkingQuellenstand:
- Google: Real-time voice applications with Gemini AudioQuellenstand:
- Google: Gemini API release notesQuellenstand:
- Google: Audio transcription with GeminiQuellenstand:
- Google: AI Studio and Gemini API available regionsQuellenstand:

