Google DeepMind lance Gemini 3.8 Live et Extended Thinking

Par: Michael Korgs | aujourd'hui, 21:39
Slide officiel présentant Gemini 3.8 Live et Extended Thinking Slide officiel présentant Gemini 3.8 Live et Extended Thinking. Source: deepmind.google

Google DeepMind a présenté deux nouveaux modèles vocaux, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, avec un accès qui s'ouvre dès aujourd'hui, 15 septembre. Les deux modèles ciblent les échanges vocaux avec prise en compte du contexte visuel en temps réel, et peuvent exécuter des tâches en arrière-plan (appels d'outils ou d'API) sans interrompre la conversation en cours.

Les deux versions ne visent pas le même usage. Gemini 3.8 Live est pensé pour des conversations rapides et fluides, avec un support visuel et linguistique en temps quasi réel, et une architecture pensée pour la mise à l'échelle et l'efficacité des coûts. Extended Thinking, de son côté, s'adresse aux tâches plus complexes qui demandent un raisonnement en plusieurs étapes.

Graphique de performance Eva Bench comparant les modèles vocaux
Graphique de performance Eva Bench comparant les modèles vocaux. Photo: deepmind.google

Sur les scores qu'elle communique elle-même, Google situe Extended Thinking en tête du classement Speech to Speech Quality Index d'Artificial Analysis, avec 82,6 points. L'entreprise avance aussi 68,6 % sur le test τ-Voice et 35,1 % sur le benchmark bancaire τ-Voice de Sierra, ainsi que 97,7 % sur Big Bench Audio. Ces chiffres restent des déclarations du constructeur, sans validation indépendante à ce stade.

Gemini 3.8 Live, plus léger, revendique la deuxième place du classement Speech Agent Arena. Google le décrit comme capable de traiter des entrées visuelles en temps quasi réel et de basculer automatiquement entre 97 langues au fil d'une même conversation.

Publicité Google Gemini pour l'offre étudiante
Publicité Google Gemini pour l'offre étudiante. Photo: deepmind.google

Le déploiement se fait par étapes. Dès aujourd'hui, les deux modèles sont accessibles aux développeurs via l'API Gemini et Google AI Studio, ainsi qu'en accès anticipé privé pour les entreprises dans Gemini Enterprise. Pour le grand public, Gemini 3.8 Live arrive dans Search Live, tandis qu'Extended Thinking est intégré à Gemini Live, à Docs pour les abonnés Google AI Pro et Ultra, et à Gmail et Keep pour tous les abonnés Google AI. L'usage via l'API de Gemini 3.8 Live est facturé 0,005 dollar (environ 0,004 €) la minute d'audio en entrée et 0,018 dollar (environ 0,016 €) la minute en sortie.

Google précise par ailleurs que tout audio généré par ses produits d'IA porte désormais un filigrane SynthID. L'annonce cite aussi plusieurs partenaires d'intégration, dont LangChain, LiveKit, Vercel et Agora.

Au moment de la publication, aucune information sur une disponibilité ou une tarification spécifiques au marché français n'était disponible.