KultureGeek Logiciels Gemini 3.5 Transcribe transforme la parole en texte avec moins d’une seconde de latence

Gemini 3.5 Transcribe transforme la parole en texte avec moins d’une seconde de latence

5 min.
27 Août. 2026 • 12:42
0

Google ouvre Gemini 3.5 Transcribe aux développeurs, avec l’ambition de proposer une transcription vocale plus précise et plus intelligente que les systèmes classiques de reconnaissance de la parole. Le modèle est disponible en préversion publique dans Google AI Studio et sur la plateforme d’agents destinée aux entreprises.

Deux interfaces distinctes sont proposées. La première traite un flux audio en temps réel avec une latence inférieure à une seconde. La seconde analyse des enregistrements déjà réalisés, comme une réunion, un entretien ou un appel, en ajoutant l’identité des intervenants et des repères temporels au niveau de chaque mot.

Gemini 3.5 Transcribe ne se limite pas à recopier littéralement ce qui est prononcé. Il peut supprimer les hésitations, tenir compte d’une correction effectuée au milieu d’une phrase et produire directement un texte ponctué et structuré. Cette capacité le rapproche d’un outil de dictée éditoriale plutôt que d’un simple moteur de sous-titrage.

Gemini 3.5 Transcribe

Plus de 85 langues et un vocabulaire personnalisable

Le modèle reconnaît automatiquement plus de 85 langues et peut gérer des changements de langue au cours d’une même conversation. Google affirme également avoir amélioré le traitement des accents régionaux, du bruit ambiant et des suites alphanumériques telles que les codes postaux, les numéros de commande ou les références techniques.

Les développeurs peuvent fournir un vocabulaire personnalisé pour aider le modèle à reconnaître un nom de produit, une expression professionnelle ou une orthographe inhabituelle. Cette possibilité est particulièrement utile dans les secteurs médicaux, juridiques et industriels, où une erreur portant sur un seul terme peut modifier le sens d’un compte rendu.

La transcription des enregistrements distingue jusqu’à trois locuteurs avec des repères temporels précis. Google présente la reconnaissance d’un nombre supérieur d’intervenants comme expérimentale. Une entreprise souhaitant analyser de grandes réunions devra donc vérifier les résultats avant d’automatiser complètement la rédaction de ses comptes rendus.

Cette mise à disposition prolonge les fonctions de dictée déjà intégrées à Gemini Intelligence sur Android. Avec Rambler, l’utilisateur peut parler naturellement, se corriger à voix haute et demander une modification de style sans recommencer la dictée depuis le début.

Des performances à interpréter avec prudence

Google communique un taux moyen d’erreur par mot de 4 % pour le traitement en direct et de 2,6 % pour les enregistrements, selon des mesures d’Artificial Analysis. Cet indicateur calcule la proportion de mots supprimés, ajoutés ou remplacés par rapport à une transcription de référence. Plus le résultat est faible, plus le texte produit est proche de la référence.

Ces moyennes ne garantissent pas la même précision dans toutes les situations. La qualité du microphone, la distance entre les intervenants, les conversations simultanées, le bruit et la langue utilisée peuvent faire varier fortement le résultat. Les chiffres publiés par Google ne doivent donc pas être interprétés comme une promesse de 97 ou 98 % de précision pour chaque enregistrement.

Sur le benchmark multilingue FLEURS, Google annonce un taux d’erreur de 5,50 % en diffusion directe et de 5,04 % pour les enregistrements. Les résultats diffèrent des moyennes précédentes parce que le jeu de données, les langues et les conditions d’évaluation ne sont pas identiques.

Le délai nécessaire pour produire la transcription définitive aurait diminué de 70 % par rapport à Chirp 3. Cette réduction compte particulièrement pour un assistant vocal : une transcription légèrement plus précise perd de son intérêt si l’utilisateur doit attendre plusieurs secondes avant que l’application réagisse.

De la transcription vers l’exécution d’actions

Gemini 3.5 Transcribe peut appeler d’autres modèles afin d’exécuter une fonction à partir de la voix. Dans l’application Gemini sur macOS, Google montre par exemple la possibilité de résumer un fichier, d’analyser un document ou de générer une image sans rédiger manuellement la demande.

Le contexte affiché à l’écran peut aussi aider le système à identifier correctement le nom d’un fichier ou un terme présent dans un document. Cette intégration nécessite une autorisation de l’utilisateur, car elle combine le contenu audio avec l’historique de conversation et les informations visibles dans l’application.

Google prévoit par ailleurs d’ajouter cette dictée intelligente à Chrome. Elle pourra être utilisée dans les champs de saisie d’un site pour rédiger une réponse, un message ou une requête. L’entreprise poursuit ainsi l’intégration de Gemini dans son navigateur, après avoir ajouté des fonctions de résumé, d’automatisation et de prise en charge du français dans Chrome.

Le marché reste très concurrentiel. Mistral propose notamment Voxtral et Voxtral Mini Transcribe, tandis qu’OpenAI, Microsoft et plusieurs spécialistes commercialisent leurs propres modèles audio. Gemini 3.5 Transcribe se distingue surtout par son association entre faible latence, contexte, nettoyage automatique et exécution d’actions. Il reste désormais à vérifier si les performances annoncées se maintiennent dans des applications réelles et dans l’ensemble des langues prises en charge.

Signaler une erreur dans le texte

Les sujets liés à ces tags pourraient vous interesser

Lisez aussi ces autres articles !

Pas d'articles en relation.

Laisser un commentaire

Sauvegarder mon pseudo et mon adresse e-mail pour la prochaine fois.

Quelques règles à respecter :
  • 1. Restez dans le sujet de l'article
  • 2. Respectez les autres lecteurs : pas de messages agressifs, vulgaires, haineux,…
  • 3. Relisez-vous avant de soumettre un commentaire : pas de langage SMS, et vérifiez l'orthographe avant de valider (les navigateurs soulignent les fautes).
  • 4. En cas d'erreur, faute d'orthographe, et/ou omission dans l'article , merci de nous contacter via la page Contact.

Nous nous réservons le droit de supprimer les commentaires qui ne respectent pas ces règles


Les derniers articles

genes dans un laboratoire

AGENTEX automatise la création de codes génétiques qui n’existent pas dans la nature

27 Août. 2026 • 13:01
0 Science

Des chercheurs ont développé une plateforme robotisée capable de concevoir et de tester des codes génétiques...

Meta Logo

Meta voulait réduire certaines équipes de 60 % grâce à l’IA, mais son projet a déraillé

27 Août. 2026 • 12:15
0 Logiciels

Meta a étudié une transformation radicale de son organisation dans laquelle des agents d’intelligence artificielle auraient...

nvidia dans la jungle avec un cameleon

Nvidia dépasse 96 milliards de dollars de revenus et prévoit encore 70 % de croissance

27 Août. 2026 • 11:38
0 Business

Nvidia vient de franchir un nouveau seuil dans l’expansion du marché de l’intelligence artificielle. Le fabricant de processeurs...

Data Center Serveurs

Amazon triple sa commande de GPU Nvidia pour répondre à l’explosion de la demande en IA

27 Août. 2026 • 10:45
0 Business

Amazon vient de renforcer son partenariat avec Nvidia et le géant de l’e-commerce ne fait pas dans la demi-mesure. Le groupe va en effet...

E.Leclerc Logo

Un piratage chez E.Leclerc expose les données des clients

27 Août. 2026 • 9:26
0 Internet

Un nouveau piratage voit le jour en France, visant cette fois E.Leclerc. C’est LCommerce, la société responsable d’Allo...

Les dernières actus Apple sur iPhoneAddict :

Comparateur

Recherchez le meilleur prix des produits Hi-tech

Recherche

Recherchez des articles sur le site