Gemini 3.5 Live Translate traduis plus de 70 langues pour des échanges vocaux instantanés

·

·

Deux personnes de langues différentes discutent dans un café moderne en utilisant un smartphone avec Gemini 3.5 Live Translate dans Google Translate pour une traduction vocale fluide et naturelle.
Résumer cet article avec :

Un échange à Tokyo, un appel à São Paulo. Désormais, la traduction vocale en direct ne se contente plus de traduire les mots : elle suit le rythme et l’émotion de la voix. Avec Gemini 3.5 Live Translate, Google rapproche les conversations multilingues d’un échange naturel, sans temps mort.


À retenir

  • Traduction en continu de la parole, avec un décalage de quelques secondes seulement.
  • Préservation de la prosodie : ton, intonation et rythme de la voix source.
  • Détection automatique de plus de 70 langues, sans réglage manuel.
  • Disponible dès maintenant sur Google Translate (Android/iOS) et Google Meet.
  • Mode écoute discret (« Listening Mode ») réservé à Android.
  • Technologie de tatouage numérique SynthID pour authentifier l’audio généré.

La traduction parole-à-parole n’est plus une succession de pauses gênantes. En traitant l’audio en continu, Gemini 3.5 Live Translate supprime ces coupures et laisse place à des échanges vraiment spontanés. L’outil vise autant les voyageurs que les équipes professionnelles, avec des exigences bien concrètes en matière de sécurité et d’intégration logicielle.

Une traduction qui reproduit l’intonation humaine

Dans cette version, la capacité à imiter la voix originale change vraiment la donne. Gemini 3.5 Live Translate ne se limite pas à convertir des mots d’une langue à une autre : il reproduit la prosodie du locuteur.

Gros plan sur une personne qui parle à son smartphone, tandis que la traduction vocale est restituée dans un écouteur, illustrant la reproduction de l’intonation par Gemini 3.5 Live Translate.
La traduction parole-à-parole reproduit désormais la prosodie du locuteur, pour une communication plus naturelle.

La prosodie, clé d’une communication naturelle

Le modèle analyse et restitue le ton, le rythme, l’intonation et la hauteur de voix de la source. Un murmure inquiet reste un murmure inquiet, une question chantante conserve sa mélodie. Pour Google, nourri par deux décennies de recherche en machine learning, l’idée est simple : la technologie doit s’effacer derrière la conversation.

Un streaming continu pour une fluidité inédite

Contrairement aux anciens systèmes qui attendaient la fin d’une phrase, ce modèle traite l’audio pendant que la personne parle encore. Résultat : quelques secondes de décalage seulement, et des conversations qui s’enchaînent sans interruption maladroite. Le traitement natif de l’audio, sans passer par une étape texte, garde le fil et évite les ruptures de rythme.

Trois terrains de jeu pour une adoption massive

Google déploie cette innovation sur ses outils grand public, ses solutions professionnelles et son infrastructure pour développeurs.

Google Translate : l’interprète de poche se perfectionne

L’application mobile intègre dès à présent la traduction vocale continue sur Android et iOS, optimisée pour une écoute au casque. Sur Android uniquement, le « Listening Mode » permet de porter le téléphone à l’oreille comme pour un appel classique et d’entendre la traduction en toute discrétion.

Google Meet : jusqu’à 2 000 combinaisons de langues simultanées

Le service de visioconférence passe de 5 à plus de 70 langues prises en charge, ce qui ouvre la porte à plus de 2 000 paires de langues possibles dans une même réunion. Le déploiement commence ce mois-ci en avant-première privée pour les clients Google Workspace Enterprise, avant un lancement global.

API Gemini Live : les développeurs entrent dans la danse

L’accès aux flux audio est aussi ouvert aux entreprises tierces via Google AI Studio. Des partenaires comme Agora et LiveKit testent déjà cette infrastructure pour des services de conciergerie ou d’assistance client. La tarification s’établit à environ 3 euros par million de tokens audio en entrée et 18 euros en sortie (conversion au taux de 1 USD = 0,85 EUR).

Transparence et limites : la face plus technique

Pour un usage en conditions réelles, Gemini 3.5 Live Translate a été conçu pour résister aux environnements bruyants et aux chevauchements de voix. Côté sécurité, chaque flux audio généré par l’IA est marqué avec le tatouage numérique SynthID, un signal imperceptible qui permet d’identifier le contenu synthétique et de lutter contre la désinformation.

Un ingénieur surveille plusieurs écrans affichant des ondes audio et une interface de visioconférence Google Meet, tandis que l’audio généré par l’IA est marqué avec SynthID.
La dimension technique de Gemini 3.5 Live Translate combine résistance au bruit et traçabilité de l’audio via SynthID pour limiter les abus.

Quelques contraintes demeurent : la durée d’une session de traduction dans Google Meet est limitée à 90 minutes pour garantir la stabilité, et la prise en charge des dialectes ou du langage très informel reste à améliorer. Google dit faire progresser la qualité en continu grâce à l’apprentissage sur de vastes corpus.

Avec Gemini 3.5 Live Translate, Google mise sur l’invisible : une technologie qui s’efface derrière la conversation. Le test sera simple : voir si, du guichet de gare à la visioconférence internationale, ces outils font vraiment gagner en fluidité.


Sur le même Thème :

Laisser un commentaire

Trop d’infos IA ?

Inscrivez-vous à la newsletter pour recevoir un résumé hebdomadaire directement dans ta boite email (et rien d’autre)