Génie Artificiel
English

Créer des voix IA réalistes avec ElevenLabs : tutoriel pas à pas (2026)

Tutoriel ElevenLabs 2026 : choisir entre v4 et v3, trouver une voix française, utiliser les balises audio, préparer le texte, cloner sa voix et exporter.

Cette page contient des liens affiliés : si vous vous abonnez via l’un d’eux, nous touchons une commission, sans surcoût pour vous.

Sommaire
  1. Ce qu’il faut avant de commencer
  2. Étape 1 : choisir le modèle selon l’usage
  3. Étape 2 : trouver une voix française dans la bibliothèque
  4. Étape 3 (facultative) : créer une voix avec Voice Design
  5. Étape 4 : régler stabilité, similarité, style et vitesse
  6. Étape 5 : diriger Eleven v3 avec les balises audio
  7. Étape 6 : préparer un texte français que la voix lit bien
  8. Étape 7 : cloner votre voix avec le clonage instantané
  9. Étape 8 : générer, écouter et exporter
  10. Droits commerciaux : ce que permet chaque formule
  11. Erreurs fréquentes et solutions
  12. Questions fréquentes

À la fin de ce tutoriel, vous aurez une voix off en français générée par ElevenLabs à partir de votre texte, avec une voix choisie ou créée pour votre projet, dirigée avec le modèle adapté, puis téléchargée. Comptez huit étapes. Un compte gratuit suffit pour s’entraîner (environ 10 minutes de voix par mois, usage non commercial) ; pour publier une vidéo monétisée ou cloner votre voix, il faut au moins la formule Starter à 6 $ par mois hors taxes (tarifs, vérifiés le 25/09/2026).

Le choix du modèle a été actualisé le 28/09/2026 pour Eleven v4 ; les étapes et exemples spécifiques à v3 sont identifiés comme tels. Pour les prix détaillés, les autres fonctions (doublage, musique, agents vocaux) et la comparaison avec Murf, voyez notre fiche ElevenLabs : prix, offre gratuite et limites.

Ce qu’il faut avant de commencer

Créez un compte sur ElevenLabs (lien affilié : nous touchons une commission si vous prenez un abonnement, sans surcoût pour vous). Toutes les fonctions partagent le même stock de crédits : en synthèse vocale, 1 caractère coûte 1 crédit, soit environ 1 000 crédits par minute de voix.

Ce qui compte pour ce tutoriel, formule par formule (page tarifs, vérifiée le 25/09/2026) :

FormulePrix mensuel (HT)Voix générée par moisUsage commercialClonage instantanéExport audio
Gratuit0 $environ 10 minNon, et mention obligatoireNonMP3 128 kbps
Starter6 $environ 30 minOuiOuiMP3 128 kbps
Creator22 $ (11 $ le premier mois)environ 121 minOuiOui, plus le clonage professionnelMP3 128 et 192 kbps
Pro99 $environ 600 minOuiOuiMP3 128 et 192 kbps, WAV/PCM 44,1 kHz

La limite dépend du modèle et de l’interface : v4 accepte jusqu’à 10 000 caractères dans la documentation des modèles, v3 jusqu’à 5 000. Vérifiez aussi le compteur de votre espace Text to Speech ; pour un contenu long, Studio permet de travailler par passages (modèles, consultés le 28/09/2026).

Étape 1 : choisir le modèle selon l’usage

Le modèle se choisit dans les réglages de la page Text to Speech. D’après le guide Text to Speech, c’est le deuxième facteur de qualité après la voix.

Votre besoinModèlePourquoi
Nouvelle voix off, narration, clone professionnelEleven v4Génération actuelle, plus de 90 langues, jusqu’à 10 000 caractères
Conversation en temps réelEleven v4 TurboVariante de v4 destinée aux échanges vocaux
Reprendre un projet ou les exemples de balises ci-dessousEleven v3Expressif, se dirige avec des balises audio, plus de 70 langues, 5 000 caractères par génération
Livre audio, long texte, voix très régulièreMultilingual v2« Le plus stable sur les générations longues » selon ElevenLabs ; 29 langues, dont le français de France et du Canada ; accepte les pauses <break>
Temps réel, assistant vocal, gros volumes par APIFlash v2.5Réponse en 75 ms environ, 32 langues, moitié moins de crédits par caractère via l’API

Eleven v3 n’est pas fait pour le temps réel : sa latence est plus élevée et son rendu varie davantage d’une génération à l’autre. Les anciens Turbo v2/v2.5 sont remplacés par Flash ; v4 Turbo est un nouveau modèle distinct (documentation des modèles, consultée le 28/09/2026).

Pour un nouveau projet, essayez v4 sur quelques phrases. Comparez avec votre ancien modèle avant de changer toute une narration. v4 et v4 Turbo sont disponibles depuis le 28/09/2026 (annonce officielle). Les exemples de réglages et de balises ci-dessous précisent quand ils concernent v3.

Étape 2 : trouver une voix française dans la bibliothèque

La voix reste déterminante, mais l’accent dépend aussi du modèle. Avec v4, ElevenLabs annonce une adaptation à l’accent natif de la langue cible, même si la voix source parle une autre langue (annonce v4, consultée le 28/09/2026). Écoutez un extrait dans votre langue avant de générer tout le script.

Pour choisir une voix française (guide de la Voice Library) :

  1. Dans la barre latérale, ouvrez Voices, puis Explore : c’est la bibliothèque de voix partagées par la communauté.
  2. Filtrez par langue (Language : French), puis par Accent si vous visez une variante précise du français.
  3. Affinez avec la catégorie (Narration, Advertisement, Educational…), le genre et l’âge.
  4. Écoutez les extraits, puis cliquez sur Use voice : Text to Speech s’ouvre avec la voix sélectionnée. Le bouton + l’ajoute à My Voices pour la retrouver plus tard.

Deux cas à connaître. Certaines voix sont réservées aux formules payantes (« This voice is not available for free users »). D’autres appliquent un multiplicateur de crédits, affiché sous forme d’étiquette : avec un multiplicateur x2, chaque génération coûte deux fois plus (centre d’aide, consulté le 25/09/2026).

Étape 3 (facultative) : créer une voix avec Voice Design

Si aucune voix de la bibliothèque ne convient, Voice Design crée une voix à partir d’une description écrite, dès l’offre gratuite. Chemin indiqué par la documentation : Voices, My Voices, ajouter une voix, puis Voice Design (guide Voice Design, consulté le 25/09/2026).

ElevenLabs recommande de structurer la description ainsi : langue native et variante, genre et âge, qualité audio, personnage, émotion, puis une ou deux phrases sur le timbre et le débit. Un exemple à adapter :

Native French, français de France (sans traits de français québécois). Male, 40–50. Studio quality.
Persona: narrateur de documentaire. Emotion: calm, warm, confident.
Timbre grave et chaleureux, débit posé, articulation nette, courtes pauses entre les phrases.

Et un texte d’aperçu cohérent avec cette voix (un texte long et dans le ton donne un rendu plus stable) :

Il y a vingt mille ans, ces falaises dominaient déjà la vallée. Aujourd’hui encore, le vent y raconte la même histoire… à qui prend le temps de l’écouter.

Chaque clic sur Generate voice propose trois voix et ne facture que les caractères du texte d’aperçu. Enregistrer une voix occupe un emplacement de voix personnalisée : 3 avec l’offre gratuite, 10 avec Starter, 30 avec Creator (tarifs, vérifiés le 25/09/2026). La documentation conseille d’éviter les mots d’effet (« reverb », « phone », « tape ») et de ne pas écrire « accent » quand vous parlez d’intonation. Les voix créées avec Voice Design v3 fonctionnent avec Eleven v3 et ses balises audio.

Étape 4 : régler stabilité, similarité, style et vitesse

Les contrôles disponibles changent selon le modèle. Avec v4, commencez par les valeurs proposées dans l’interface ; le tableau suivant décrit les réglages classiques de v2/Flash, puis les particularités de v3. Valeurs de départ et effets selon le guide Text to Speech (consulté le 25/09/2026) :

RéglageCe qu’il changePoint de départ conseillé
StabilityPlus bas : voix plus expressive mais imprévisible, parfois trop rapide. Plus haut : voix régulière, jusqu’à la monotonieAutour de 50
SimilarityFidélité à la voix d’origine. Trop haut avec une source bruitée : reproduit les bruits et artefactsAutour de 75
Style exaggerationAccentue le style de la voix d’origine, au prix de la stabilité0
Speaker boostRapproche un peu plus de la voix d’origine ; effet discretAu choix
SpeedDe 0,7 (plus lent) à 1,2 (plus rapide), 1,0 par défaut1,0 ; les valeurs extrêmes dégradent le rendu

Avec Eleven v3, les réglages changent. La stabilité devient un choix entre trois modes (guide des bonnes pratiques) :

  • Creative : le plus expressif, mais sujet aux dérapages ;
  • Natural : le plus proche de la voix d’origine, équilibré ;
  • Robust : très stable, proche de v2, mais il réagit moins aux balises audio.

La documentation indique que Similarity, Speaker boost et Speed ne s’appliquent pas à Eleven v3 : le rythme se règle alors avec les balises audio et la ponctuation. Pour une voix off dirigée par balises, partez de Natural et passez à Creative si le jeu reste trop sage.

Les générations ne sont jamais identiques, même avec les mêmes réglages : générez deux ou trois versions et gardez la meilleure.

Étape 5 : diriger Eleven v3 avec les balises audio

Eleven v3 se dirige avec des balises audio entre crochets, placées dans le texte. Elles s’écrivent en anglais, comme dans la documentation, même quand le texte est en français. Elles règlent l’émotion ([excited], [sad], [curious]), le mode de voix ([whispers], [shouts]), les réactions ([laughs], [sighs], [clears throat]), le rythme ([pause], [slowly], [rushed]) (guide des bonnes pratiques et billet Audio Tags 101, consultés le 25/09/2026).

Exemples prêts à copier dans Text to Speech, modèle Eleven v3 sélectionné.

Introduction de vidéo YouTube :

[excited] Bienvenue dans ce nouveau tutoriel ! Aujourd’hui, on crée une voix off en moins de dix minutes. [pause] Vous êtes prêts ? C’est parti.

Narration de livre audio :

[softly] La maison était silencieuse depuis des années… [pause] Pourtant, ce soir-là, quelqu’un avait allumé une lumière au grenier. [whispers] Elle n’était pas seule.

Publicité avec changement de ton :

[sighs] Encore une facture d’électricité qui grimpe ? [pause] [excited] Avec notre simulateur, vous savez en deux minutes combien vous pouvez économiser. [slowly] Deux minutes. Pas une de plus.

Service client, ton professionnel puis rassurant :

[professional] Bonjour, et merci de votre appel. [sympathetic] Je comprends, ce retard de livraison est vraiment agaçant. [reassuring] Je regarde tout de suite où en est votre colis.

Trois règles tirées de la documentation :

  • La voix doit pouvoir jouer la balise : une voix calme et posée ne criera pas de façon convaincante avec [shouts], une voix qui chuchote ne se mettra pas à hurler.
  • Pas de <break> avec Eleven v3 : pour les pauses, utilisez [pause], les points de suspension ou un retour à la ligne. La balise <break time="1.5s" /> (3 secondes au plus) reste valable avec Multilingual v2 et Flash v2.5.
  • Les majuscules appuient un mot avec Eleven v3 : « C’était une TRÈS longue journée ».

Le bouton Enhance de l’interface ajoute automatiquement des balises à votre texte : pratique pour démarrer, à relire ensuite.

Étape 6 : préparer un texte français que la voix lit bien

La voix lit ce qui est écrit, fautes comprises : elle ne corrige rien. Le texte compte autant que les réglages (guide de dépannage, consulté le 25/09/2026).

Nombres, dates, symboles. Écrivez-les en toutes lettres, comme ils doivent être dits. ElevenLabs donne l’exemple du chiffre « 1 », à écrire « un » pour qu’il soit lu en français. Le site normalise les nombres automatiquement, mais un chiffre peut encore partir en anglais, surtout avec une voix anglaise.

Sigles et abréviations. Écrivez-les tels qu’ils se prononcent : lettres séparées pour un sigle épelé, mot complet pour une abréviation.

Ponctuation. Le point de suspension ajoute une pause et une hésitation ; le tiret donne une pause plus neutre ; les phrases courtes rendent le débit plus naturel.

Avant et après, à copier pour tester :

Texte brut :
Le 25/09/2026 à 14h30, M. Dupont a payé 6 $ pour 30 min de voix, soit -20 % vs l'an dernier (cf. RGPD).

Texte préparé :
Le vingt-cinq septembre deux mille vingt-six, à quatorze heures trente, Monsieur Dupont a payé six dollars pour trente minutes de voix. C’est vingt pour cent de moins que l’an dernier… comme le prévoit le R G P D.

Noms propres. Avec Eleven v3, vous pouvez imposer une prononciation en alphabet phonétique international (API), écrit entre barres obliques comme dans les exemples de la documentation. ElevenLabs annonce une prononciation constante dans 80 à 90 % des cas : vérifiez chaque génération.

Le rendez-vous est confirmé avec Madame "/lə.klɛʁ/" demain matin.

Sinon, réécrivez le mot comme il se prononce. Dans Studio, un dictionnaire de prononciation (fichier TXT ou PLS) applique vos règles à tout un projet (bonnes pratiques de prononciation, consultées le 25/09/2026).

Longueur. Découpez votre script par idées ou scènes pour faciliter les corrections. La recommandation de rester sous 800 à 900 caractères issue des anciens guides n’est pas une limite de v4 : celui-ci accepte jusqu’à 10 000 caractères par requête selon la documentation des modèles, consultée le 28/09/2026. Pour un livre audio, privilégiez Studio et contrôlez les raccords entre passages.

Étape 7 : cloner votre voix avec le clonage instantané

Le clonage instantané (Instant Voice Clone) est inclus dès Starter. Étapes selon le guide officiel (consulté le 25/09/2026) :

  1. Dans Voices, cliquez sur l’icône +, puis choisissez Instant Voice Clone.
  2. Importez ou enregistrez votre audio en suivant les instructions à l’écran.
  3. Nommez la voix, confirmez que vous avez le droit et le consentement pour la cloner, puis cliquez sur Save voice.
  4. Dans My Voices, cliquez sur Use voice pour l’utiliser dans Text to Speech.

Ce qui fait un bon clone :

  • 1 à 2 minutes d’audio propre, pas plus de 3 : au-delà, le gain est faible et le clone peut devenir moins stable ;
  • une seule voix, sans musique, bruit de fond ni écho de pièce ;
  • un ton et une distance au micro constants, sans chuchoter ni crier ; volume moyen entre -23 et -18 dB RMS, crêtes sous -3 dB ;
  • MP3 à 192 kbps ou plus : un WAV n’améliore pas le clone ;
  • le jeu que vous voulez obtenir : le clone reproduit votre débit et votre énergie. Enregistrez en français pour une voix qui parle français sans accent.

Un clone ne s’exporte pas : il reste dans votre compte, et seule l’API permet de l’utiliser ailleurs. Si l’accent n’est pas bien rendu, changez les échantillons ou passez au clonage professionnel (dès Creator, détaillé dans notre fiche ElevenLabs). Eleven v4 prend en charge les clones instantanés et professionnels. Pour les balises d’Eleven v3, ElevenLabs recommande un clone instantané ou une voix Voice Design : les clones professionnels ne sont pas encore pleinement optimisés pour ce modèle.

Consentement. La politique d’utilisation interdit de cloner la voix d’une autre personne sans son consentement ou un droit légal. Pour la voix d’un collègue, d’un comédien ou d’une marque, faites signer un accord écrit avant d’enregistrer.

Étape 8 : générer, écouter et exporter

  1. Cliquez sur Generate speech. Chaque génération est facturée, même si vous ne la téléchargez pas.
  2. Écoutez. Si le rendu ne va pas, vous avez droit à deux régénérations gratuites, à condition de garder le même texte, la même voix et le même modèle (les curseurs peuvent changer), dans les deux heures et sans recharger la page. Le bouton affiche alors « Regenerate speech » (centre d’aide, consulté le 25/09/2026).
  3. Téléchargez le fichier avec le bouton de téléchargement, en bas à droite après la génération, ou plus tard depuis l’onglet d’historique du panneau de droite.

Depuis l’historique, le téléchargement propose MP3 ou WAV, et Advanced donne accès à d’autres formats (MP3 192 ou 256 kbps, M4A, FLAC) (centre d’aide, consulté le 25/09/2026). La qualité disponible dépend de la formule : selon le tableau comparatif de la page tarifs, MP3 128 kbps en gratuit et en Starter, 192 kbps à partir de Creator, WAV/PCM 44,1 kHz à partir de Pro (vérifié le 25/09/2026).

Pour habiller votre voix off, voyez aussi nos tutoriels pour créer une vidéo pédagogique avec Synthesia et ChatGPT et pour créer de la musique avec l’IA.

Droits commerciaux : ce que permet chaque formule

Règles de publication d’ElevenLabs (centre d’aide, consulté le 25/09/2026) :

  • Offre gratuite : aucun usage commercial. Tout contenu publié doit porter « elevenlabs.io » ou « 11.ai » dans son titre.
  • Formules payantes : licence commerciale incluse, sans limite de durée pour ce qui a été généré pendant l’abonnement, à condition de détenir les droits sur le texte et la voix utilisés.
  • Pas de rattrapage : un audio généré en gratuit (avant ou après un abonnement) ne devient jamais commercial. Régénérez-le une fois abonné.
  • Services en bêta exclus : leur contenu ne peut servir ni commercialement ni en production.

Une vidéo YouTube monétisée, une publicité ou un projet client relèvent de l’usage commercial : prévoyez donc au moins Starter.

Erreurs fréquentes et solutions

La voix sonne métallique ou pleine d’artefacts

  • Si les défauts apparaissent sur un long passage, isolez la phrase problématique et régénérez-la ; 800 caractères n’est pas une limite universelle.
  • Style exaggeration est au-dessus de 0 : ElevenLabs recommande de le laisser à 0, car il peut ajouter des bruits et rendre le débit irrégulier.
  • Avec une voix clonée, Similarity trop haut reproduit les défauts de l’enregistrement d’origine : baissez-le, ou refaites le clone avec un audio plus propre.
  • Trop de balises <break> dans un même texte accélèrent la voix et ajoutent des artefacts.
  • Un son étouffé ou déformé peut survenir au hasard : régénérez le passage (gratuitement si les conditions de l’étape 8 sont réunies).

La voix a un accent anglais ou change d’accent

  • La voix n’est pas francophone : prenez une voix filtrée « French » dans la bibliothèque, ou clonez une voix enregistrée en français.
  • Sur un passage long ou multilingue, comparez un extrait plus court avec le même modèle pour repérer la cause de la dérive.
  • Avec Voice Design, la description doit commencer par la langue et sa variante (« Native French, français de France »).
  • Les chiffres et sigles sont lus en anglais : écrivez-les en toutes lettres.

Des coupures, des pauses bizarres ou une voix trop rapide

  • Stability trop basse donne une voix imprévisible qui parle trop vite : remontez vers 50, ou passez en Natural avec Eleven v3.
  • Une voix clonée à partir d’extraits courts et hachés hérite de ce rythme : ElevenLabs conseille des échantillons plus longs et continus.
  • Les points de suspension ajoutent de l’hésitation : pour une pause neutre, préférez le tiret, [pause] avec Eleven v3, ou <break> avec Multilingual v2.
  • Dans Studio, un souffle ou un accroc entre deux paragraphes vient souvent du paragraphe précédent : régénérez celui-là.
  • Si le compteur de votre interface refuse le texte, découpez-le ou utilisez Studio ; la limite dépend du modèle et de la formule.

Les crédits partent trop vite

  • Chaque clic sur Generate est facturé, téléchargement ou non. Mettez au point voix et réglages sur une ou deux phrases avant de lancer le texte complet.
  • Profitez des deux régénérations gratuites : même texte, même voix, même modèle, curseurs modifiables.
  • Vérifiez l’étiquette de multiplicateur de crédits avant d’adopter une voix de la bibliothèque.
  • Voice Design ne facture que les caractères du texte d’aperçu, une seule fois pour les trois voix proposées.
  • Sur une formule payante, les crédits non utilisés se reportent pendant deux mois au plus ; l’offre gratuite ne reporte rien (tarifs, vérifiés le 25/09/2026).

Questions fréquentes

ElevenLabs est-il gratuit pour créer une voix off ?

Oui pour s’entraîner : l’offre gratuite donne environ 10 minutes de voix par mois, avec Eleven v3 et Voice Design, mais sans clonage ni usage commercial, et avec « elevenlabs.io » ou « 11.ai » dans le titre de tout contenu publié. Starter coûte 6 $ par mois hors taxes (vérifié le 25/09/2026 sur la page tarifs).

Comment faire parler ElevenLabs en français ?

Écrivez simplement votre texte en français : le modèle détecte la langue d’après le texte, il n’y a pas de langue à choisir sur le site. Pour éviter l’accent anglais, utilisez une voix francophone de la bibliothèque (filtre Language : French) ou une voix clonée en français.

Quel modèle choisir pour une voix off en français ?

Eleven v4 pour commencer un nouveau projet ; Eleven v3 pour reprendre les exemples de balises de ce tutoriel, Multilingual v2 pour un long texte au rendu très régulier, Flash v2.5 pour le temps réel. Ces modèles prennent en charge le français.

Peut-on cloner la voix de quelqu’un d’autre ?

Seulement avec son consentement ou un droit légal : la politique d’utilisation d’ElevenLabs l’impose, et l’interface vous demande de le confirmer avant d’enregistrer le clone. Prévoyez un accord écrit.

Existe-t-il une alternative pour la voix off professionnelle ?

Murf Studio vise la voix off de formation et de présentation. Canva est intégré dès Creator ; PowerPoint et Google Slides demandent Business. Le clonage personnalisé est une option Enterprise, à distinguer du doublage d’un enregistrement dans Murf Dub (tarifs, vérifiés le 30/09/2026). La comparaison chiffrée figure dans notre fiche ElevenLabs. Pour mettre en ligne votre voix off sous forme d’émission, voyez aussi notre tutoriel pour automatiser un podcast.

  • Murf

    Voix & audio

    Idéal pour : créateurs, indépendants et équipes formation qui produisent des voix off ou localisent des vidéos.

    • Offre gratuite : essai gratuit
    • Fiche mise à jour le
  • ElevenLabs

    Voix & audio

    Idéal pour : créateurs de vidéos et de livres audio, équipes de localisation et développeurs d’assistants vocaux.

    • Offre gratuite : oui
    • Fiche mise à jour le
    Essayer ElevenLabs

    Lien affilié : nous touchons une commission

  • Synthesia

    Vidéo

    Idéal pour : équipes formation, RH et communication interne qui produisent des vidéos régulières en plusieurs langues.

    • Offre gratuite : oui
    • Fiche mise à jour le
    Essayer Synthesia

    Lien affilié : nous touchons une commission

Tapez au moins deux lettres.