Gemini 3.8 Live : Google lance ses modèles vocaux avec raisonnement étendu
- Google annonce Gemini 3.8 Live et 3.8 Live Extended Thinking, deux modèles optimisés pour la conversation vocale en temps quasi-réel.
- Le 3.8 Live vise la scalabilité et l'efficacité des coûts ; le 3.8 Live Extended Thinking s'attaque aux tâches complexes avec raisonnement multi-étapes.
- Les deux modèles gèrent les entrées visuelles en temps réel, exécutent les outils en arrière-plan et supportent 97 langues en transition midstream.
- Disponibles dès maintenant via l'API Gemini, Google Workspace et l'appli Gemini.
Ce que dit la source
Google présente ces deux modèles comme sa réponse aux limites actuelles des assistants vocaux : conversations qui restent fluides même lors de tâches complexes, sans interruption de dialogue, avec capacité à raisonner en arrière-plan. Google affirme que le 3.8 Live Extended Thinking atteint le premier rang du Speech to Speech Quality Index (82,6) et le 68,6 % sur le benchmark τ-Voice, tout en restant compétitif en prix face aux autres modèles de frontier.
- Gemini 3.8 Live : construit pour l'échelle et l'efficacité coût, combine intelligence conversationnelle, dialogue fluide et ancrage visuel temps quasi-réel
- Le 3.8 Live Extended Thinking revendique la première place sur l'Artificial Analysis' Speech to Speech Quality Index (82,6) et le leadership en agentic task completion (68,6 % sur τ-Voice)
- Traitement visuel en temps quasi-réel, détection automatique et transition entre 97 langues en cours de conversation
- Exécution d'outils et d'appels API en arrière-plan sans interruption du dialogue, avec reconnaissance vocale d'indices précoces (« Let me check that… ») pour maintenir la fluidité
- Disponibilité : Gemini Live API, Google Workspace (Docs Live, Gmail Live, Keep Live), Search Live, et appli Gemini ; partenaires intégrateurs listés (Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents)
Dans les commentaires
Peu de débat substantiel. Les commentaires se concentrent sur des questions de déploiement, des impressions personnelles sur la qualité vocale et une critique isolée sur une démo de démo maladroite.
- Un commentateur soulève que Google Workspace Business Standard n'affiche que Gemini 3.6 Flash et Thinking, pas 3.7 ou 3.8, soulevant une question d'adoption réelle vs. annonces
- La qualité de la voix synthétisée divise : un utilisateur trouve Live Mode bien meilleur que GPT Voice en fluidité conversationnelle ; un autre juge la synthèse vocale désagréable
- Une démo vidéo critiquée : le modèle perd face à un motif d'échec-et-mat classique, ce qui contredit le message des capacités les plus avancées
- Demandes pratiques non répondues : disponibilité sur Vertex AI, délai de déploiement pour Google AI Plus, pas d'information fournie
- Un commentaire laconique (« Thinking Good one ») qui peut indiquer du scepticisme sur les revendications de raisonnement, bien que peu détaillé
Notre lecture
Les annonces de Google sur la fluidité conversationnelle et la qualité vocale semblent convaincantes pour les early adopters qui testent en parallèle avec ChatGPT Voice. Cependant, le fil HN révèle deux questions pratiques non adressées : (1) la distribution réelle à travers Google Workspace reste lente et inégale, contrairement à l'annonce d'une « disponibilité immédiate », (2) le gap réel entre les benchmarks vendus et les limitations démontrées en direct (échec au chess) crée un doute sur la véracité des revendications de performance. Pour une équipe évaluant une intégration vocale, à tester via l'API, mais valider d'abord les performances réelles avant de bâtir une stratégie sur les benchmarks publiés. La question du déploiement réel dans Workspace mérite clarification auprès de Google avant engagement significant.