ElevenLabs vient de lancer Eleven v3 en alpha, et c’est probablement la mise à jour la plus sérieuse qu’ils aient faite depuis le lancement de leur modèle multilingue. Deux grandes nouveautés : le support de plus de 70 langues, et un système de balises audio intégré directement dans le texte pour contrôler l’expressivité vocale. Ce que tu vas apprendre :

  • Comment fonctionne le système de balises audio d’Eleven v3 et ce que tu peux contrôler concrètement
  • Ce que couvre vraiment le support de 70+ langues (et où ça décroche)
  • Comment Eleven v3 se compare aux versions précédentes sur la qualité et le contrôle
  • Pour quels cas d’usage cette mise à jour change vraiment quelque chose
  • Les prix, l’accès API et la promo de lancement jusqu’à fin juin 2025

Ce qui change vraiment avec Eleven v3

Soyons clairs. La plupart des mises à jour de modèles vocaux consistent à annoncer une « amélioration de la qualité » sans que tu puisses le mesurer. Eleven v3 apporte deux changements structurels, pas juste un meilleur score de naturalité sur un benchmark opaque. Le premier changement, c’est l’architecture de contrôle : tu ne joues plus seulement sur la vitesse ou le ton global dans un panneau séparé. Tu insères des balises directement dans le texte, au moment précis où tu veux l’effet. C’est un passage d’un contrôle global à un contrôle ponctuel, et pour la production de contenu long, c’est une différence réelle. Le deuxième changement, c’est l’ambition multilingue. Plus de 70 langues, c’est un chiffre qui positionne ElevenLabs clairement contre des services comme Google Cloud TTS ou Azure Cognitive Services. La question honnête, c’est de savoir si toutes ces langues sont au même niveau de qualité, et la réponse courte, c’est non.

Diagramme comparant le contrôle vocal global par sliders et le contrôle inline par balises audio insérées dans le script d'Eleven v3.
À gauche, l'ancien modèle : trois curseurs (ton, vitesse, stabilité) appliqués uniformément à tout le script. À droite, Eleven v3 : des balises comme [warm], [excited], [pause], [whisper] ou [serious] s'insèrent directement dans le texte, et les flèches montrent qu'elles agissent uniquement sur le segment qui suit — la direction vocale devient locale, presque une partition.

Le système de balises audio : comment ça fonctionne

Le principe est simple : tu écris ton texte normalement, et tu insères des balises spéciales à l’endroit où tu veux modifier la livraison vocale. Pense à du HTML pour la voix, sauf que les attributs contrôlent l’emphase, la pause, le ton, l’hésitation. Concrètement, les balises permettent de signaler des moments expressifs sans réécrire ton prompt ou changer de voix. Tu peux marquer une pause dramatique avant une révélation, augmenter l’emphase sur un mot clé, ou indiquer une hésitation naturelle qui rend la voix moins robotique. C’est ce que les ingénieurs audio appellent du contrôle prosodique, la plupart des outils TTS t’en offrent peu ou pas du tout au niveau du texte lui-même.

Ce que ça change en pratique : au lieu de générer plusieurs versions d’un même segment pour trouver la bonne intonation, tu annotes ton script une fois et tu génères. Ça réduit les itérations en production audio batch de façon significative. Le système de balises est particulièrement intéressant pour les équipes qui génèrent du contenu à grande échelle : podcasts automatisés, narrations d’articles, audiobooks, scripts publicitaires. Tu scriptés l’expressivité comme tu scriptes le texte lui-même.

interface de l'éditeur de texte avec balises audio insérées inline dans un paragraphe, montrant le panneau de prévisualisation à droite
interface de l'éditeur de texte avec balises audio insérées inline dans un paragraphe, montrant le panneau de prévisualisation à droite

Plus de 70 langues : portée réelle et limites à connaître

Le truc c’est que « 70+ langues supportées » dit peu sur la qualité réelle par langue. ElevenLabs est franc là-dessus dans leur documentation : la qualité varie selon la quantité de données d’entraînement disponibles pour chaque langue. Les langues à fort volume de données (anglais, espagnol, français, allemand, japonais, portugais) livrent une qualité comparable au meilleur de ce qui existe sur le marché. Pour les langues moins dotées, comme plusieurs langues africaines ou certaines langues d’Asie du Sud-Est, la naturalité sera correcte mais en deçà des langues principales. C’est honnête à savoir avant de décider si ElevenLabs couvre ton marché cible. Pour le français québécois spécifiquement, le modèle supporte le français, mais la distinction entre variantes régionales reste un angle mort de la plupart des modèles TTS actuels. Si tu produis du contenu pour un public québécois, prévois des tests de validation avant de déployer en production.

Carte mondiale stylisée au trait indiquant les zones de couverture linguistique forte et variable d'Eleven v3, sans frontières politiques.
Répartition indicative de la couverture d'Eleven v3 : zones denses (points serrés) pour les langues à forte représentation — anglais, espagnol, français, allemand — et zones clairsemées (pointillés) pour les langues où l'expressivité et la stabilité de la voix restent inégales. Représentation purement éditoriale.

Règle de base : teste systématiquement dans ta langue cible avec un script représentatif de ton contenu, pas juste avec la phrase de démo générique. Les différences de qualité se révèlent sur des textes techniques ou des noms propres.


Comparaison avec les versions précédentes d’ElevenLabs

ElevenLabs a sorti plusieurs modèles avant v3 : Eleven Multilingual v1, Eleven Multilingual v2, Eleven Turbo. Voici comment v3 se distingue sur les axes qui comptent.

Dimension v2 Multilingual Turbo v2 Eleven v3
Contrôle prosodique inline Non Non Oui (balises audio)
Nombre de langues Plusieurs dizaines Quelques dizaines 70+
Latence (batch/async) Standard Faible (optimisé temps réel) Standard
Cas d'usage principal Production qualité Temps réel / streaming Production expressivité
Disponibilité GA GA Alpha (juin 2025)

La distinction Turbo vs v3 est importante : Turbo est optimisé pour la latence (streaming temps réel, agents vocaux). Eleven v3 est optimisé pour l’expressivité et la couverture linguistique en mode batch. Ce ne sont pas des compétiteurs directs, tu choisis selon ton cas d’usage.

Maquette d'interface ElevenLabs affichant un menu déroulant de sélection de modèle vocal avec trois options : Eleven v3, Eleven Turbo et Eleven Multilingual v2, chacune accompagnée d'une courte description.
Le sélecteur de modèle dans l'interface ElevenLabs : v3 pour l'expressivité et le multilingue, Turbo pour la latence, v2 pour la stabilité en production.

Cas d’usage concrets pour la production de contenu audio

Eleven v3 est pertinent dans trois contextes bien précis. Podcasts et narrations longues. Le contrôle inline par balises te permet de scripter des pauses naturelles et des variations d’emphase sur un script de plusieurs minutes sans multiplier les passes de génération. Pour des équipes qui produisent plusieurs épisodes par semaine, le gain en itérations est réel. Contenu multilingue à l’échelle. Si tu distribues du contenu dans plusieurs marchés, tu peux maintenant maintenir une cohérence de voix et d’expressivité sur un nombre significatif de langues depuis la même API. Avant, tu devais souvent jongler entre plusieurs fournisseurs selon la langue cible. Audiobooks et contenu éducatif. Les balises audio permettent de distinguer les dialogues de la narration, de marquer les emphases pédagogiques, d’indiquer les transitions. C’est exactement le type de contenu où la monotonie d’un TTS standard devient insupportable après quelques minutes. Là où c’est superflu : si tu génères des courtes notifications système, des CAPTCHA vocaux, ou tout contenu court et fonctionnel sans enjeu expressif, Turbo v2 ou même des solutions moins coûteuses font le travail sans la complexité des balises.

Prix, accès et intégration via API

Eleven v3 est lancé en alpha le 3 juin 2025. Pendant la période de lancement jusqu’à fin juin 2025, ElevenLabs offre une réduction de 80% sur le tarif standard via l’interface self-serve, ce qui revient à environ cinq fois moins cher qu’au prix régulier. Pour les clients enterprise, la même réduction de 80% s’applique sur le tarif business plan. Voici les plans disponibles :

Plan Prix mensuel (USD) Accès v3
Free 0 $US/mois À vérifier selon les conditions alpha
Starter 6 $US/mois À vérifier selon les conditions alpha
Creator 22 $US/mois Probable
Pro 99 $US/mois Oui
Scale 299 $US/mois Oui
Business 990 $US/mois Oui

Pour l’intégration API, ElevenLabs expose Eleven v3 via leur API REST standard. Si tu as déjà intégré leurs modèles précédents, le changement principal est l’ajout du paramètre de modèle et la syntaxe des balises audio dans le champ texte. La documentation officielle détaille la liste des balises supportées et leur comportement, consulte-la directement, les balises disponibles sont susceptibles d’évoluer pendant la phase alpha.


Pour qui c’est utile, pour qui c’est superflu

C’est utile si :

  • Tu produis du contenu audio long ou semi-long à une cadence régulière (podcasts, narrations, audiobooks)
  • Tu travailles en plusieurs langues et tu veux consolider ton pipeline sous une seule API
  • Tu automatises la génération audio en batch et tu cherches à réduire les itérations manuelles d’ajustement
  • Tu construis des agents vocaux ou des expériences de narration où l’expressivité fait partie du produit C’est superflu si :
  • Ton cas d’usage est uniquement en anglais et tu n’as pas besoin de contrôle prosodique fin
  • Tu génères du contenu court et fonctionnel (notifications, alertes, réponses système courtes)
  • Tu travailles principalement en temps réel, Turbo v2 reste plus adapté pour ce contexte
  • Tu n’as pas encore de pipeline audio automatisé, commence avec une solution plus simple avant d’intégrer les balises Le vrai public cible d’Eleven v3, c’est les équipes de contenu et les développeurs qui ont déjà un pipeline audio et qui cherchent à monter en qualité sans multiplier les fournisseurs. Si tu en es là, la promo de lancement est une bonne fenêtre pour tester sérieusement.

Verdict

Eleven v3 est la mise à jour la plus substantielle d’ElevenLabs depuis un bon moment. Le système de balises audio change concrètement le workflow pour la production de contenu long, et le support de 70+ langues est réel, avec des nuances de qualité à tester sur ta langue cible avant de déployer. La période alpha au tarif fortement réduit est une opportunité claire pour les équipes qui hésitent à intégrer un outil TTS de qualité dans leur pipeline. Teste avant la fin de la promo, compare avec ta solution actuelle sur un script représentatif, et décide avec des données réelles.

Pas plus compliqué que ça.

On continue à la Taverne ?

Un courriel par semaine. Pas de fluff.

En t'abonnant, tu reçois Le Tour de Table chaque semaine. Tu peux te désabonner en un clic. Voir notre politique de confidentialité.

Texte par David Cyr