Le spot Braise du chapitre 7 est monté, cohérent, spectaculaire — et muet. Ce chapitre lui donne ce qui lui manque : la voix off dirigée dans ElevenLabs, le jingle composé dans Suno, et les règles de droits qui séparent un usage pro d'un procès en devenir.
L'audio est le média génératif le plus mûr de toute la boîte à outils : c'est aussi celui où les réglages par défaut produisent le plus sûrement du travail d'amateur. On va régler les curseurs.
L'oreille juge avant l'œil
Un spectateur pardonne une image imparfaite. Il ne pardonne pas une voix robotique, une musique de banque de sons entendue mille fois, des niveaux qui sautent d'un plan à l'autre.
Dans tout ce que j'ai produit en vidéo, l'audio est ce qui trahit l'amateurisme en premier, et de loin.
La bonne nouvelle : c'est le média génératif le plus mûr. La synthèse vocale est utilisable en production depuis des années, le clonage est devenu une formalité technique, et la musique générée tient la comparaison avec la banque de sons pour l'usage qui nous concerne : habiller un contenu de marque.
Maya, la torréfactrice du chapitre 1, a besoin des deux : une voix pour le spot Braise, un jingle pour tout le reste. Son studio audio tiendra dans deux outils : ElevenLabs pour la voix, Suno pour la musique.

v3, v2, Flash : trois moteurs, trois usages
ElevenLabs est la référence du text-to-speech — le TTS, la synthèse vocale — et du clonage multilingue, et son premier piège est là : trois moteurs cohabitent, et le plus récent n'est pas toujours le bon.
Eleven v3, disponible pour tous début 2026, comprend les didascalies (les audio tags, on y vient) et donne les lectures les plus expressives ; c'est aussi le moins prévisible. Multilingual v2, l'ancien, reste le choix officiel pour la narration neutre longue : moins de surprises sur vingt minutes de texte. Flash v2.5 coûte deux fois moins de crédits et répond en ~75 ms : parfait pour les brouillons et les formats jetables.
Deux curseurs reviennent dans tous les réglages, posons-les une fois : stability, la régularité de la lecture — bas, la voix ose ; haut, elle récite — et similarity, la fidélité au timbre d'origine.
| Moteur | Usage et réglages (relevé en août 2026) |
|---|---|
| Eleven v3 | Pub, personnages, documentaire : tout ce qui joue. Mode Stability sur Creative ou Natural pour que les tags agissent, Robust si la lecture déraille |
| Multilingual v2 | Narration longue et stable : YouTube, e-learning. Stability ~0,65, similarity 0,70-0,85 ; podcast posé : 0,75 et 0,90 |
| Flash v2.5 | Brouillons, réseaux sociaux, volume. ~75 ms de latence, ~0,5 crédit par caractère : deux fois moins cher |
Deux repères que la doc officielle confirme : en v2, une similarity à 100 % introduit des artefacts (restez sous 85 %), et en v3 le mode Creative est « expressif mais sujet aux hallucinations » : commencez en Natural, montez en Creative seulement si la lecture reste plate.
Diriger la lecture : les audio tags
La différence entre une voix off correcte et une voix off dirigée, c'est la direction d'acteur. En v3, elle s'écrit entre crochets, directement dans le texte. Cinq règles d'expérience couvrent l'essentiel :
- 01 · Les tags, entre crochets
[whispers],[excited],[sighs],[pause],[laughs]. Un tag s'applique jusqu'à la pause naturelle suivante, et ils se combinent :[sighs, sadly]. - 02 · La ponctuation fait le resteLes points de suspension posent une pause et du poids, les MAJUSCULES appuient un mot, une phrase courte tombe net.
- 03 · On dirige, on ne force pasLa doc le dit sans détour : n'attendez pas d'une voix qui chuchote qu'elle hurle sur un
[shouts]. Un clone posé avec un tag hystérique sonne faux. - 04 · La bonne fenêtre de textev3 déteste les textes courts : sous ~250 caractères, les sorties deviennent incohérentes. À l'inverse, ne collez jamais vingt mille caractères d'un coup : la fenêtre utile est de 500 à 1 500 caractères — le chunk, dans le jargon des outils.
- 05 · Régénérer petitQuand une lecture déraille, on régénère la phrase fautive, pas le pavé entier relancé (et refacturé).
Le tag ne crée pas ce que la voix n'a pas : on dirige un acteur, on ne le remplace pas.
Ce découpage en chunks est exactement le genre de travail qu'on ne fait pas à la main. Pour la voix off du spot Braise, je fais préparer le terrain par l'agent :
❯ claude ❯ Lis briefs/spot-braise.md et voix/off-spot.md. Découpe ❯ la voix off en chunks de 500 à 1500 caractères, un ❯ fichier par chunk dans audio/chunks/, coupe uniquement ❯ en fin de phrase. Pose les tags v3 selon le brief et ❯ épelle les acronymes en phonétique française. · Claude découpe le script... 6 chunks : 01-ouverture.txt à 06-signature.txt. « UGC » devient « u-gé-cé ». Tags : [warm] sur l'ouverture, [pause] avant le prix, rien sur la signature : la voix retombe naturellement. ❯ Pourquoi rien sur le chunk 6 ? Le brief demande une fin sobre. Un tag ajouterait une intention là où le silence travaille mieux.
Les pièges du français
Le français est langue Tier 1 sur v3 — le premier rang, le mieux servi — et il garde ses chausse-trappes. Trois pièges reviennent :
- 01 · Les acronymes« SNCF » ou « SEO » lus à l'anglaise ruinent une phrase. Épelez-les phonétiquement dans le script (« l'esse-eu-o ») : c'est le rôle de la passe de préparation ci-dessus.
- 02 · Les nombresIls basculent parfois en prononciation anglaise au milieu d'un texte, sans prévenir.
- 03 · La dérive de langueSur les textes longs, une voix non native glisse vers l'accent anglais paragraphe après paragraphe. Les parades : choisir une voix nativement française, découper court, et pour la voix de marque, cloner une voix qui parle réellement français.
Cloner sa voix : IVC pour essayer, PVC pour de vrai
ElevenLabs propose deux clonages, et ils ne jouent pas dans la même cour. L'Instant Voice Cloning (IVC) se contente d'une à trois minutes d'audio : suffisant pour tester le pipeline, pas pour signer une marque. Le Professional Voice Cloning (PVC) entraîne un vrai modèle sur vos enregistrements. La marche à suivre qui donne un bon clone :
- Testez en IVCTrois minutes d’audio, dix minutes de manipulation : vous validez que le pipeline complet (script, chunks, montage) tient avant d’investir dans l’enregistrement sérieux.
- Enregistrez pour le PVC : 30 minutes plancher, 2 à 3 heures pour un résultat optimalUn seul locuteur, pas de bruit de fond, pas de réverb, niveau constant. Le point que tout le monde découvre trop tard : le clone reproduit TOUT, les bruits de bouche comme le registre. Des échantillons lus d’un ton plat donnent un clone plat.
- Passez la vérification d'identitéElevenLabs exige une vérification vocale : vous ne clonez que votre propre voix, ou celle d’une personne qui la passe elle-même. C’est une contrainte, et c’est aussi votre protection.
- Pour l’émotion que le TTS rate, jouez-la vous-mêmeLe Voice Changer convertit votre interprétation micro en voix cible en gardant l’intention : c’est l’astuce des studios pour les lignes que les tags n’attrapent pas.
Maya s'enregistre un dimanche matin : trente minutes au micro, dans la pièce la plus meublée de l'appartement — les rideaux mangent la réverb. Le clone qui sort reproduit tout : le timbre, les fins de phrase, deux bruits de bouche qu'elle ne s'était jamais entendus faire, et ce débit qui accélère dès qu'elle parle d'origines. Elle voulait une voix de marque ; elle découvre que la sienne en était déjà une, tics compris.
Le PVC demande un abonnement Creator (22 $/mois, relevé en août 2026), l'IVC est disponible dès Starter.
Le jingle Braise, composé dans Suno
Côté musique, Suno v5.5 est l'outil le plus utilisé du marché : des chansons complètes, voix comprise, à partir de deux champs de texte. Le premier champ décrit le style, le second porte les paroles et la structure. Tout se joue dans la précision du premier. La formule qui marche tient en cinq parties, dans cet ordre :
- Le genreUn ou deux tags, le premier pèse le plus. « warm acoustic folk-pop », pas « musique sympa ».
- Le moodExplicite, sinon Suno penche « upbeat » par défaut. « cozy morning energy, intimate ».
- La voix, en trois couchesCaractère (« soft female vocal »), délivrance (« breathy »), effet (« light reverb »).
- L'instrumentation nommée« fingerpicked nylon guitar, soft brushes, warm upright bass », jamais « guitare et batterie ».
- La production et le BPM« analog warmth, 92 BPM » — battements par minute, le tempo. Le BPM précis est le paramètre le plus ignoré et l’un des plus efficaces.
Visez 8 à 15 tags : en dessous de 5 c'est vague, au-delà de 20 tout se dilue. Dans les paroles, les meta tags structurent le morceau : [Intro], [Verse], [Chorus], [Outro] puis [End], qui évite la fin qui traîne. La technique qui change tout est la syntaxe paramétrée par section : [Verse: whispered vocals, acoustic guitar only] puis [Chorus: full band, layered vocals] donne un contrôle de niveau DAW — le logiciel de studio, type Logic ou Ableton — sans DAW.
Pour le jingle Braise, je génère cinq à dix variantes courtes, je garde la meilleure, et j'exporte les stems, les pistes séparées (jusqu'à 12) : l'instrumental seul passe sous la voix off ElevenLabs au montage, le hook chanté — le refrain accrocheur — vit sa vie en signature de fin. Budget réaliste : 50 à 100 crédits pour une piste soignée, pas les 10 de la démo.
Suno, Udio, Eleven Music : le comparatif musique
Le paysage d'août 2026, tel que je le pratique :
| Outil | Verdict (relevé en août 2026) |
|---|---|
| Suno v5.5 | Le plus utilisé et le plus simple : chansons complètes avec voix. Le choix par défaut pour un jingle de marque |
| Udio | Le contrôle fin : pour qui veut itérer section par section et sculpter |
| Eleven Music | La qualité et surtout les droits : entraîné sous licences Merlin et Kobalt, sorties annoncées « cleared for commercial use ». L’option la plus sûre juridiquement pour un usage pro |
| Soundraw | Le fond sonore libre de droits au kilomètre, sans prétention artistique |
| AIVA | Le fond orchestral : bandes-annonces, corporate cinématique |
Mon arbitrage : Suno pour créer une identité sonore, Eleven Music dès que le morceau part en pub payante ou chez un client dont le juridique pose des questions, Soundraw ou AIVA quand il faut juste remplir le silence.
Ce que vous générez aujourd'hui n'aura peut-être pas le même régime demain : archivez vos fichiers, datez vos licences, et pour tout usage commercial engageant, préférez l'outil né licencié. Même logique côté voix : cloner un tiers exige son consentement écrit, et l'AI Act impose de divulguer le contenu synthétique.
Les erreurs qui coûtent
Entre
- Passer au tier payant AVANT de générer ce qui sera publié : les droits commerciaux Suno couvrent les titres créés pendant l’abonnement
- Décrire un son : « intimate female vocal, breathy, analog warmth »
- Fixer le BPM et le mood, sinon l’outil choisit pour vous
- Budgéter les régénérations : le coût réel constaté est 2 à 3 fois le théorique, et 10 à 15 % du quota part en tests
- Régénérer phrase par phrase dans ElevenLabs, section par section dans Suno
On évite
- Générer sur le tier gratuit puis monétiser : zéro droit commercial, chez Suno comme chez ElevenLabs
- Nommer des artistes réels dans un prompt : bloqué, et c’est tant mieux
- Coller un script entier d’un coup et payer trois relances complètes
- Enregistrer des morceaux IA à la SACEM : elle exige une création humaine, et la fausse déclaration vaut exclusion
- Laisser les crédits guider le calendrier : chez Suno ils ne se reportent pas, chez ElevenLabs ils disparaissent au passage à un abonnement inférieur
Les prix, relevés en août 2026
Les chiffres qui suivent viennent des pages tarifs officielles, relevés le 7 août 2026 ; ils changent tous les trimestres, revérifiez avant de vous engager.
- ElevenLabs Free10 000 crédits/mois, usage non commercial uniquement.
- ElevenLabs Starter · 6 $/mois30 000 crédits, licence commerciale, IVC. Environ 1 000 crédits par minute de voix.
- ElevenLabs Creator · 22 $/mois~121 000 crédits (environ 2 h de voix), PVC, et Eleven Music inclus à ~900 crédits la minute de musique.
- Suno Free50 crédits/jour, écoute et partage seulement, aucun droit commercial.
- Suno Pro · 10 $/mois(8 $ en annuel) 2 500 crédits, droits commerciaux sur les titres créés pendant l’abonnement.
- Suno Premier · 30 $/mois(24 $ en annuel) 10 000 crédits, Studio et stems avancés.
Le studio audio de Maya : Starter chez ElevenLabs (6 $) pour valider le pipeline, puis Creator (22 $) le mois où elle clone sa voix de marque — c'est l'abonnement que retiendra le bilan du chapitre 12 — et Pro chez Suno. Soit 16 $ par mois pour démarrer, 32 $ en vitesse de croisière une fois le clone en service.
Le spot parle
Reste à fermer la promesse d'ouverture. Sur la table de montage : les cinq plans Quality du chapitre 7, les six chunks de voix — le clone de Maya, dirigé au tag près —, l'instrumental du jingle et son hook chanté.
❯ Assemble sorties/spot/ : les 5 plans Quality dans ❯ l'ordre de la shot list, la voix off par-dessus, ❯ l'instrumental Suno dessous, à bas niveau. Le hook ❯ chanté seul sur le plan final. · Claude monte et cale les niveaux... spot-braise-40s.mp4 : 40 secondes. Voix calée sur les plans, musique sous la voix, hook en signature sur la tasse fumante.
Questions fréquentes sur la voix et la musique IA
Comment cloner sa voix avec ElevenLabs ?
Deux niveaux : l'Instant Voice Cloning produit un clone en quelques minutes à partir de 1 à 3 minutes d'audio, suffisant pour tester ; le Professional Voice Cloning entraîne un modèle dédié à partir de 30 minutes d'enregistrement minimum, 2 à 3 heures pour un résultat optimal, avec vérification d'identité vocale obligatoire. Un seul locuteur, pas de bruit ni de réverb : le clone reproduit tout, défauts compris, et le registre des échantillons devient le registre de sortie. Le PVC demande un abonnement Creator (22 $/mois, relevé en août 2026).
Suno est-il autorisé commercialement ?
Sur les tiers payants (Pro à 10 $/mois, Premier à 30 $/mois, relevés en août 2026), oui : vous recevez des droits commerciaux sur les titres créés pendant votre abonnement. Le tier gratuit ne donne aucun droit commercial et se limite désormais à l'écoute et au partage. Attention au contexte : depuis l'accord avec Warner fin 2025, Suno déploie en 2026 des modèles licenciés, déprécie les anciens et plafonne les téléchargements mensuels. Le régime de droits est en mouvement : datez vos générations et conservez la preuve de votre abonnement au moment de la création.
Quelle musique IA pour ses vidéos ?
Suno v5.5 pour composer une vraie identité sonore, chansons complètes avec voix : c'est l'outil le plus simple et le plus utilisé. Udio si vous voulez itérer finement section par section. Eleven Music quand le juridique prime : entraîné sous licences Merlin et Kobalt, sorties annoncées cleared for commercial use, c'est l'option la plus sûre pour la pub et les clients exigeants. Pour du simple fond sonore libre de droits, Soundraw fait le travail, et AIVA pour l'orchestral.
La suiteLe spot parle. Mais la vidéo générative excelle sur l'émotion et échoue sur la précision : un chiffre exact, une courbe qui monte juste, un texte net à l'écran. Pour la vidéo des statistiques de torréfaction de Braise, il faut une machine qui ne se trompe jamais sur un nombre. Au chapitre 9, on écrit la vidéo en code — braise-hero-01.png n'a pas fini de servir, et la voix clonée de Maya non plus.
La suite par email
Recevez les prochains chapitres.
Les guides s'écrivent chapitre par chapitre et se révisent quand les outils bougent. Laissez votre email : un message à chaque publication ou révision majeure, rien d'autre.
Uniquement les publications des guides. Désinscription sur simple réponse.
Pour votre équipe
Ce guide existe aussi en formation.
Le guide donne la méthode, la formation l'installe : une à deux journées avec votre équipe, sur vos projets réels, avec un plan d'outillage à la fin.
Discutons de votre équipeDavid Silvera
Développeur mobile & web freelance · 15 ans · Android, iOS, React Native, Next.js
Ce guide est tiré de ma pratique : les vidéos, les visuels, la musique et les articles de mes projets sortent du pipeline qu'il enseigne, ce site compris. J'accompagne aussi les équipes qui veulent monter en compétence : audit de pratique, formation, mise en place d'outillage.