Google accélère l’adoption de l’IA conversationnelle avec deux nouveaux modèles Gemini, annoncés ce mardi 15 septembre. Ces innovations visent à transformer l’expérience des agents vocaux, tant pour les entreprises que pour les utilisateurs finaux.
Les deux modèles, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, répondent à des besoins distincts. Le premier est optimisé pour la scalabilité et l’efficacité coût, tandis que le second se concentre sur des tâches complexes à un prix compétitif face aux modèles concurrents. Une avancée majeure réside dans leurs capacités de raisonnement en temps quasi réel, rendant les interactions vocales plus naturelles et intuitives.
Ces modèles offrent aux développeurs et aux entreprises des briques de construction pour déployer des agents vocaux prêts à l’emploi. Ils améliorent également les échanges avec Gemini, que ce soit via l’application dédiée, Google Workspace ou la recherche.
Cette annonce s’inscrit dans une tendance plus large : la voix devient l’infrastructure centrale du commerce agentique. Comme le rapportait PYMNTS en février, les investissements dans l’IA native vocale se multiplient, confirmant que cette technologie passe du statut d’accessoire à celui de pilier essentiel. La voix agit comme un intermédiaire entre les grands modèles linguistiques et les transactions utilisateurs, réduisant les frictions au moment crucial de l’achat.
Le rapport de juillet de PYMNTS soulignait par ailleurs la transition des assistants vocaux, passant de la simple réponse aux questions à l’exécution d’actions. Des exemples concrets illustrent cette évolution : le mode vocal de Claude permet d’effectuer des tâches dans des applications connectées sans saisir de texte, tandis qu’OpenAI’s Presence équipe les entreprises d’agents vocaux et textuels pour le support client et les ventes.
Google avait déjà franchi un cap en septembre avec l’intégration de nouvelles fonctionnalités vocales dans Gmail, Google Docs et Keep. Ces outils permettent désormais de rechercher des informations par conversation dans les emails, d’éditer des documents en temps réel via le dialogue, ou encore d’organiser ses idées en notes structurées.
‘À mesure que la technologie évolue, nos méthodes de travail changent’, déclarait Google lors de cette annonce. ‘C’est pourquoi nous intégrons les modèles Gemini Audio à vos produits Workspace préférés pour accomplir des tâches quotidiennes simplement par la voix.’
Ces innovations confirment l’engagement de Google dans l’écosystème de l’IA conversationnelle, positionnant la voix comme un vecteur clé de productivité et d’efficacité.