David Silvera.
David SilveraApplications mobiles & sites web
BlogDiscutons de votre équipeContact→
  • Tous les guidesLe hub des guides
  • Coder avec ClaudeLes bonnes pratiques Claude Code
  • Créer du contenu pro avec l'IAVidéo, images, musique, articles
← Le guide

Chapitre 08 · Acte II · Un atelier par média

La bande-son

David Silvera6 août 202612 min de lecture

Dans ce chapitre

  • Choisir entre v3, v2 et Flash selon l’usage, et diriger une lecture aux audio tags
  • Cloner une voix proprement, du clone-minute d'essai au clone professionnel vérifié
  • Composer une musique de marque dans Suno et savoir quand le juridique impose Eleven Music

Dans cet article

L'oreille juge avant l'œilv3, v2, Flash : trois moteurs, trois usagesDiriger la lecture : les audio tagsLes pièges du françaisCloner sa voix : IVC pour essayer, PVC pour de vraiLe jingle Braise, composé dans SunoSuno, Udio, Eleven Music : le comparatif musiqueLes prix, relevés en août 2026Le spot parleQuestions fréquentes

Le guide

  1. 01 Un studio dans un terminal
  2. 02 Votre voix, pas celle du modèle
  3. 03 Écrire ce qui se lit
  4. 04 La data qui prouve
  5. 05 La donnée devient visuel
  6. 06 L'image exacte
  7. 07 La vidéo générative
  8. 08 La bande-son
  9. 09 La vidéo écrite en code
  10. 10 Une source, dix formats
  11. 11 Publier sans se griller
  12. 12 La boucle de retour

Le spot Braise du chapitre 7 est monté, cohérent, spectaculaire — et muet. Ce chapitre lui donne ce qui lui manque : la voix off dirigée dans ElevenLabs, le jingle composé dans Suno, et les règles de droits qui séparent un usage pro d'un procès en devenir.

L'audio est le média génératif le plus mûr de toute la boîte à outils : c'est aussi celui où les réglages par défaut produisent le plus sûrement du travail d'amateur. On va régler les curseurs.

L'oreille juge avant l'œil

Un spectateur pardonne une image imparfaite. Il ne pardonne pas une voix robotique, une musique de banque de sons entendue mille fois, des niveaux qui sautent d'un plan à l'autre.

Dans tout ce que j'ai produit en vidéo, l'audio est ce qui trahit l'amateurisme en premier, et de loin.

La bonne nouvelle : c'est le média génératif le plus mûr. La synthèse vocale est utilisable en production depuis des années, le clonage est devenu une formalité technique, et la musique générée tient la comparaison avec la banque de sons pour l'usage qui nous concerne : habiller un contenu de marque.

Maya, la torréfactrice du chapitre 1, a besoin des deux : une voix pour le spot Braise, un jingle pour tout le reste. Son studio audio tiendra dans deux outils : ElevenLabs pour la voix, Suno pour la musique.

Un script et une piste musicale entrent dans une table de mixage ; une seule bande sonore continue en sort.
La voix, la musique, puis le mixage : la bande-son se construit en chaîne, pas en un seul geste.

v3, v2, Flash : trois moteurs, trois usages

ElevenLabs est la référence du text-to-speech — le TTS, la synthèse vocale — et du clonage multilingue, et son premier piège est là : trois moteurs cohabitent, et le plus récent n'est pas toujours le bon.

Eleven v3, disponible pour tous début 2026, comprend les didascalies (les audio tags, on y vient) et donne les lectures les plus expressives ; c'est aussi le moins prévisible. Multilingual v2, l'ancien, reste le choix officiel pour la narration neutre longue : moins de surprises sur vingt minutes de texte. Flash v2.5 coûte deux fois moins de crédits et répond en ~75 ms : parfait pour les brouillons et les formats jetables.

Deux curseurs reviennent dans tous les réglages, posons-les une fois : stability, la régularité de la lecture — bas, la voix ose ; haut, elle récite — et similarity, la fidélité au timbre d'origine.

MoteurUsage et réglages (relevé en août 2026)
Eleven v3Pub, personnages, documentaire : tout ce qui joue. Mode Stability sur Creative ou Natural pour que les tags agissent, Robust si la lecture déraille
Multilingual v2Narration longue et stable : YouTube, e-learning. Stability ~0,65, similarity 0,70-0,85 ; podcast posé : 0,75 et 0,90
Flash v2.5Brouillons, réseaux sociaux, volume. ~75 ms de latence, ~0,5 crédit par caractère : deux fois moins cher

Deux repères que la doc officielle confirme : en v2, une similarity à 100 % introduit des artefacts (restez sous 85 %), et en v3 le mode Creative est « expressif mais sujet aux hallucinations » : commencez en Natural, montez en Creative seulement si la lecture reste plate.

Diriger la lecture : les audio tags

La différence entre une voix off correcte et une voix off dirigée, c'est la direction d'acteur. En v3, elle s'écrit entre crochets, directement dans le texte. Cinq règles d'expérience couvrent l'essentiel :

  • 01 · Les tags, entre crochets[whispers], [excited], [sighs], [pause], [laughs]. Un tag s'applique jusqu'à la pause naturelle suivante, et ils se combinent : [sighs, sadly].
  • 02 · La ponctuation fait le resteLes points de suspension posent une pause et du poids, les MAJUSCULES appuient un mot, une phrase courte tombe net.
  • 03 · On dirige, on ne force pasLa doc le dit sans détour : n'attendez pas d'une voix qui chuchote qu'elle hurle sur un [shouts]. Un clone posé avec un tag hystérique sonne faux.
  • 04 · La bonne fenêtre de textev3 déteste les textes courts : sous ~250 caractères, les sorties deviennent incohérentes. À l'inverse, ne collez jamais vingt mille caractères d'un coup : la fenêtre utile est de 500 à 1 500 caractères — le chunk, dans le jargon des outils.
  • 05 · Régénérer petitQuand une lecture déraille, on régénère la phrase fautive, pas le pavé entier relancé (et refacturé).
Le tag ne crée pas ce que la voix n'a pas : on dirige un acteur, on ne le remplace pas.

Ce découpage en chunks est exactement le genre de travail qu'on ne fait pas à la main. Pour la voix off du spot Braise, je fais préparer le terrain par l'agent :

chunks-voix-off
❯ claude
❯ Lis briefs/spot-braise.md et voix/off-spot.md. Découpe
❯ la voix off en chunks de 500 à 1500 caractères, un
❯ fichier par chunk dans audio/chunks/, coupe uniquement
❯ en fin de phrase. Pose les tags v3 selon le brief et
❯ épelle les acronymes en phonétique française.
· Claude découpe le script...
6 chunks : 01-ouverture.txt à 06-signature.txt.
« UGC » devient « u-gé-cé ». Tags : [warm] sur
l'ouverture, [pause] avant le prix, rien sur la
signature : la voix retombe naturellement.
❯ Pourquoi rien sur le chunk 6 ?
Le brief demande une fin sobre. Un tag ajouterait
une intention là où le silence travaille mieux.
❯claudeclaude
❯Lis briefs/spot-braise.md et voix/off-spot.md. DécoupeLis briefs/spot-braise.md et voix/off-spot.md. Découpe
❯la voix off en chunks de 500 à 1500 caractères, unla voix off en chunks de 500 à 1500 caractères, un
❯fichier par chunk dans audio/chunks/, coupe uniquementfichier par chunk dans audio/chunks/, coupe uniquement
❯en fin de phrase. Pose les tags v3 selon le brief eten fin de phrase. Pose les tags v3 selon le brief et
❯épelle les acronymes en phonétique française.épelle les acronymes en phonétique française.
Claude découpe le script
6 chunks : 01-ouverture.txt à 06-signature.txt.
« UGC » devient « u-gé-cé ». Tags : [warm] sur
l'ouverture, [pause] avant le prix, rien sur la
signature : la voix retombe naturellement.
❯Pourquoi rien sur le chunk 6 ?Pourquoi rien sur le chunk 6 ?
Le brief demande une fin sobre. Un tag ajouterait
une intention là où le silence travaille mieux.
Chaque chunk part ensuite dans ElevenLabs, et seules les phrases ratées sont régénérées. Sur un spot de 40 secondes, la différence de facture est anecdotique ; sur un livre audio, elle est structurelle.

Les pièges du français

Le français est langue Tier 1 sur v3 — le premier rang, le mieux servi — et il garde ses chausse-trappes. Trois pièges reviennent :

  • 01 · Les acronymes« SNCF » ou « SEO » lus à l'anglaise ruinent une phrase. Épelez-les phonétiquement dans le script (« l'esse-eu-o ») : c'est le rôle de la passe de préparation ci-dessus.
  • 02 · Les nombresIls basculent parfois en prononciation anglaise au milieu d'un texte, sans prévenir.
  • 03 · La dérive de langueSur les textes longs, une voix non native glisse vers l'accent anglais paragraphe après paragraphe. Les parades : choisir une voix nativement française, découper court, et pour la voix de marque, cloner une voix qui parle réellement français.

Cloner sa voix : IVC pour essayer, PVC pour de vrai

ElevenLabs propose deux clonages, et ils ne jouent pas dans la même cour. L'Instant Voice Cloning (IVC) se contente d'une à trois minutes d'audio : suffisant pour tester le pipeline, pas pour signer une marque. Le Professional Voice Cloning (PVC) entraîne un vrai modèle sur vos enregistrements. La marche à suivre qui donne un bon clone :

  1. Testez en IVCTrois minutes d’audio, dix minutes de manipulation : vous validez que le pipeline complet (script, chunks, montage) tient avant d’investir dans l’enregistrement sérieux.
  2. Enregistrez pour le PVC : 30 minutes plancher, 2 à 3 heures pour un résultat optimalUn seul locuteur, pas de bruit de fond, pas de réverb, niveau constant. Le point que tout le monde découvre trop tard : le clone reproduit TOUT, les bruits de bouche comme le registre. Des échantillons lus d’un ton plat donnent un clone plat.
  3. Passez la vérification d'identitéElevenLabs exige une vérification vocale : vous ne clonez que votre propre voix, ou celle d’une personne qui la passe elle-même. C’est une contrainte, et c’est aussi votre protection.
  4. Pour l’émotion que le TTS rate, jouez-la vous-mêmeLe Voice Changer convertit votre interprétation micro en voix cible en gardant l’intention : c’est l’astuce des studios pour les lignes que les tags n’attrapent pas.

Maya s'enregistre un dimanche matin : trente minutes au micro, dans la pièce la plus meublée de l'appartement — les rideaux mangent la réverb. Le clone qui sort reproduit tout : le timbre, les fins de phrase, deux bruits de bouche qu'elle ne s'était jamais entendus faire, et ce débit qui accélère dès qu'elle parle d'origines. Elle voulait une voix de marque ; elle découvre que la sienne en était déjà une, tics compris.

Le PVC demande un abonnement Creator (22 $/mois, relevé en août 2026), l'IVC est disponible dès Starter.

Le jingle Braise, composé dans Suno

Côté musique, Suno v5.5 est l'outil le plus utilisé du marché : des chansons complètes, voix comprise, à partir de deux champs de texte. Le premier champ décrit le style, le second porte les paroles et la structure. Tout se joue dans la précision du premier. La formule qui marche tient en cinq parties, dans cet ordre :

  1. Le genreUn ou deux tags, le premier pèse le plus. « warm acoustic folk-pop », pas « musique sympa ».
  2. Le moodExplicite, sinon Suno penche « upbeat » par défaut. « cozy morning energy, intimate ».
  3. La voix, en trois couchesCaractère (« soft female vocal »), délivrance (« breathy »), effet (« light reverb »).
  4. L'instrumentation nommée« fingerpicked nylon guitar, soft brushes, warm upright bass », jamais « guitare et batterie ».
  5. La production et le BPM« analog warmth, 92 BPM » — battements par minute, le tempo. Le BPM précis est le paramètre le plus ignoré et l’un des plus efficaces.

Visez 8 à 15 tags : en dessous de 5 c'est vague, au-delà de 20 tout se dilue. Dans les paroles, les meta tags structurent le morceau : [Intro], [Verse], [Chorus], [Outro] puis [End], qui évite la fin qui traîne. La technique qui change tout est la syntaxe paramétrée par section : [Verse: whispered vocals, acoustic guitar only] puis [Chorus: full band, layered vocals] donne un contrôle de niveau DAW — le logiciel de studio, type Logic ou Ableton — sans DAW.

Pour le jingle Braise, je génère cinq à dix variantes courtes, je garde la meilleure, et j'exporte les stems, les pistes séparées (jusqu'à 12) : l'instrumental seul passe sous la voix off ElevenLabs au montage, le hook chanté — le refrain accrocheur — vit sa vie en signature de fin. Budget réaliste : 50 à 100 crédits pour une piste soignée, pas les 10 de la démo.

Suno, Udio, Eleven Music : le comparatif musique

Le paysage d'août 2026, tel que je le pratique :

OutilVerdict (relevé en août 2026)
Suno v5.5Le plus utilisé et le plus simple : chansons complètes avec voix. Le choix par défaut pour un jingle de marque
UdioLe contrôle fin : pour qui veut itérer section par section et sculpter
Eleven MusicLa qualité et surtout les droits : entraîné sous licences Merlin et Kobalt, sorties annoncées « cleared for commercial use ». L’option la plus sûre juridiquement pour un usage pro
SoundrawLe fond sonore libre de droits au kilomètre, sans prétention artistique
AIVALe fond orchestral : bandes-annonces, corporate cinématique

Mon arbitrage : Suno pour créer une identité sonore, Eleven Music dès que le morceau part en pub payante ou chez un client dont le juridique pose des questions, Soundraw ou AIVA quand il faut juste remplir le silence.

Le droit de la musique IA bouge sous vos pieds. Eleven Music est né licencié : accords avec Merlin (30 000 labels indépendants) et Kobalt, août 2025. Suno a signé avec Warner fin 2025 après procès : en 2026, des modèles licenciés arrivent, les anciens seront dépréciés, le tier gratuit perd le téléchargement et les tiers payants prennent des plafonds mensuels.

Ce que vous générez aujourd'hui n'aura peut-être pas le même régime demain : archivez vos fichiers, datez vos licences, et pour tout usage commercial engageant, préférez l'outil né licencié. Même logique côté voix : cloner un tiers exige son consentement écrit, et l'AI Act impose de divulguer le contenu synthétique.

Les erreurs qui coûtent

Entre

  • −Passer au tier payant AVANT de générer ce qui sera publié : les droits commerciaux Suno couvrent les titres créés pendant l’abonnement
  • −Décrire un son : « intimate female vocal, breathy, analog warmth »
  • −Fixer le BPM et le mood, sinon l’outil choisit pour vous
  • −Budgéter les régénérations : le coût réel constaté est 2 à 3 fois le théorique, et 10 à 15 % du quota part en tests
  • −Régénérer phrase par phrase dans ElevenLabs, section par section dans Suno

On évite

  • +Générer sur le tier gratuit puis monétiser : zéro droit commercial, chez Suno comme chez ElevenLabs
  • +Nommer des artistes réels dans un prompt : bloqué, et c’est tant mieux
  • +Coller un script entier d’un coup et payer trois relances complètes
  • +Enregistrer des morceaux IA à la SACEM : elle exige une création humaine, et la fausse déclaration vaut exclusion
  • +Laisser les crédits guider le calendrier : chez Suno ils ne se reportent pas, chez ElevenLabs ils disparaissent au passage à un abonnement inférieur

Les prix, relevés en août 2026

Les chiffres qui suivent viennent des pages tarifs officielles, relevés le 7 août 2026 ; ils changent tous les trimestres, revérifiez avant de vous engager.

  • ElevenLabs Free10 000 crédits/mois, usage non commercial uniquement.
  • ElevenLabs Starter · 6 $/mois30 000 crédits, licence commerciale, IVC. Environ 1 000 crédits par minute de voix.
  • ElevenLabs Creator · 22 $/mois~121 000 crédits (environ 2 h de voix), PVC, et Eleven Music inclus à ~900 crédits la minute de musique.
  • Suno Free50 crédits/jour, écoute et partage seulement, aucun droit commercial.
  • Suno Pro · 10 $/mois(8 $ en annuel) 2 500 crédits, droits commerciaux sur les titres créés pendant l’abonnement.
  • Suno Premier · 30 $/mois(24 $ en annuel) 10 000 crédits, Studio et stems avancés.

Le studio audio de Maya : Starter chez ElevenLabs (6 $) pour valider le pipeline, puis Creator (22 $) le mois où elle clone sa voix de marque — c'est l'abonnement que retiendra le bilan du chapitre 12 — et Pro chez Suno. Soit 16 $ par mois pour démarrer, 32 $ en vitesse de croisière une fois le clone en service.

Le spot parle

Reste à fermer la promesse d'ouverture. Sur la table de montage : les cinq plans Quality du chapitre 7, les six chunks de voix — le clone de Maya, dirigé au tag près —, l'instrumental du jingle et son hook chanté.

montage-spot-braise
❯ Assemble sorties/spot/ : les 5 plans Quality dans
❯ l'ordre de la shot list, la voix off par-dessus,
❯ l'instrumental Suno dessous, à bas niveau. Le hook
❯ chanté seul sur le plan final.
· Claude monte et cale les niveaux...
spot-braise-40s.mp4 : 40 secondes. Voix calée sur
les plans, musique sous la voix, hook en signature
sur la tasse fumante.
❯Assemble sorties/spot/ : les 5 plans Quality dansAssemble sorties/spot/ : les 5 plans Quality dans
❯l'ordre de la shot list, la voix off par-dessus,l'ordre de la shot list, la voix off par-dessus,
❯l'instrumental Suno dessous, à bas niveau. Le hookl'instrumental Suno dessous, à bas niveau. Le hook
❯chanté seul sur le plan final.chanté seul sur le plan final.
Claude monte et cale les niveaux
spot-braise-40s.mp4 : 40 secondes. Voix calée sur
les plans, musique sous la voix, hook en signature
sur la tasse fumante.
Quarante secondes plus tard, Maya a entendu sa marque pour la première fois. La voix est la sienne — celle du dimanche matin au micro —, la fin sobre du chunk 6 tombe exactement sur le plan final, et le hook chante là où le silence aurait laissé le spot s'éteindre. Le chapitre s'ouvrait sur un spot muet ; il se ferme sur un spot qui parle avec la voix de la torréfactrice.

Questions fréquentes sur la voix et la musique IA

Comment cloner sa voix avec ElevenLabs ?

Deux niveaux : l'Instant Voice Cloning produit un clone en quelques minutes à partir de 1 à 3 minutes d'audio, suffisant pour tester ; le Professional Voice Cloning entraîne un modèle dédié à partir de 30 minutes d'enregistrement minimum, 2 à 3 heures pour un résultat optimal, avec vérification d'identité vocale obligatoire. Un seul locuteur, pas de bruit ni de réverb : le clone reproduit tout, défauts compris, et le registre des échantillons devient le registre de sortie. Le PVC demande un abonnement Creator (22 $/mois, relevé en août 2026).

Suno est-il autorisé commercialement ?

Sur les tiers payants (Pro à 10 $/mois, Premier à 30 $/mois, relevés en août 2026), oui : vous recevez des droits commerciaux sur les titres créés pendant votre abonnement. Le tier gratuit ne donne aucun droit commercial et se limite désormais à l'écoute et au partage. Attention au contexte : depuis l'accord avec Warner fin 2025, Suno déploie en 2026 des modèles licenciés, déprécie les anciens et plafonne les téléchargements mensuels. Le régime de droits est en mouvement : datez vos générations et conservez la preuve de votre abonnement au moment de la création.

Quelle musique IA pour ses vidéos ?

Suno v5.5 pour composer une vraie identité sonore, chansons complètes avec voix : c'est l'outil le plus simple et le plus utilisé. Udio si vous voulez itérer finement section par section. Eleven Music quand le juridique prime : entraîné sous licences Merlin et Kobalt, sorties annoncées cleared for commercial use, c'est l'option la plus sûre pour la pub et les clients exigeants. Pour du simple fond sonore libre de droits, Soundraw fait le travail, et AIVA pour l'orchestral.

La suiteLe spot parle. Mais la vidéo générative excelle sur l'émotion et échoue sur la précision : un chiffre exact, une courbe qui monte juste, un texte net à l'écran. Pour la vidéo des statistiques de torréfaction de Braise, il faut une machine qui ne se trompe jamais sur un nombre. Au chapitre 9, on écrit la vidéo en code — braise-hero-01.png n'a pas fini de servir, et la voix clonée de Maya non plus.

← Chapitre 07La vidéo générativeChapitre 09 →La vidéo écrite en code

La suite par email

Recevez les prochains chapitres.

Les guides s'écrivent chapitre par chapitre et se révisent quand les outils bougent. Laissez votre email : un message à chaque publication ou révision majeure, rien d'autre.

Uniquement les publications des guides. Désinscription sur simple réponse.

Pour votre équipe

Ce guide existe aussi en formation.

Le guide donne la méthode, la formation l'installe : une à deux journées avec votre équipe, sur vos projets réels, avec un plan d'outillage à la fin.

Discutons de votre équipe→
DS

David Silvera

Développeur mobile & web freelance · 15 ans · Android, iOS, React Native, Next.js

Ce guide est tiré de ma pratique : les vidéos, les visuels, la musique et les articles de mes projets sortent du pipeline qu'il enseigne, ce site compris. J'accompagne aussi les équipes qui veulent monter en compétence : audit de pratique, formation, mise en place d'outillage.

DSDavid Silvera

Ingénieur mobile & web freelance · 15 ans

Écrivez-moi

dav.silvera@gmail.com

Réponse sous 24 h

Ailleurs

  • Recommandations
  • LinkedIn
  • YouTube

Prestations

  • Développeur Android freelance
  • Développeur iOS freelance
  • Application mobile sur mesure

Guides IA

  • Tous les guides
  • Coder avec Claude
  • Créer du contenu pro avec l'IA
  • Accompagner mon équipe sur l'IA

Le site

  • Étude de cas · CRM terrain
  • Blog
  • Mentions légales
© 2026 David Silvera · Création d'applications mobiles & de sites web sur mesure
Discutons de votre équipeContact→