AI Studios Blog
Dans un studio de bruitage la nuit, une bruiteuse agenouillée au bord d'une fosse de gravier pose des bottes en cuir sur les cailloux face à un écran qui projette un chemin forestier boueux, sous une perche micro
Workflow créatif · 11 min de lecture

Bruitage IA : donner un vrai son à tes vidéos

Ambiances, pas, portes, whooshs : quels outils de bruitage IA utiliser, comment les écrire et les caler pour que ta vidéo IA arrête de sonner creux.

Publié le · 11 min de lecture

Coupe le son d'une vidéo IA réussie et regarde-la en muet : elle tient. Remets l'audio natif et quelque chose cloche. Les pas ne tombent pas sur les pieds, le vent change de couleur à chaque coupe, la pièce n'a aucune résonance. Le spectateur ne saura pas te dire quoi, il sentira juste que c'est faux.

Tu vas voir comment découper le son d'une vidéo en trois couches, quel outil d'IA sert à quoi (ElevenLabs, MMAudio, Kling, Firefly, plus une banque gratuite), comment écrire un prompt de bruitage qui sonne, et dans quel ordre tout poser sur la timeline.

Dans la plupart des workflows IA que je vois passer, l'image a pris beaucoup d'avance sur le son. Les outils n'y sont pour pas grand-chose : le son arrive en dernier, la veille de la livraison, quand il ne reste plus d'énergie pour lui. Une heure de méthode sur la bande-son, et le même film paraît nettement plus fini.

Bruitage IA : une bande-son se monte en trois couches

Le bruitage désigne les sons ajoutés en postproduction pour compléter la bande sonore d'un film avant le mixage. Les Anglo-Saxons parlent de Foley, du nom de Jack Foley, qui a commencé à recréer les pas des comédiens en studio à la fin des années 1920. Un bruiteur travaille avec des objets et avec son corps : chaussures, vêtements, portes, eau.

L'IA remplace la fosse de gravier et la vieille porte par un champ de texte ou une analyse d'image. La logique de fond ne bouge pas : une bande-son se construit par couches empilées, et chacune a son rôle.

Ambiance, synchro, design

L'ambiance, d'abord, est le fond continu : rumeur de ville, pièce vide, forêt, salle de restaurant. Elle ne se remarque pas, sauf quand elle s'arrête. C'est elle qui colle les plans entre eux, et c'est elle que l'audio natif des générateurs vidéo casse à chaque coupe.

Par-dessus viennent les sons synchro, ceux qu'on voit se produire : pas, froissement de manteau, tasse posée, porte qui claque. Ils doivent tomber à l'image près. Couche la plus difficile, et justement celle où les modèles vidéo vers audio servent à quelque chose.

Reste le design sonore : des sons absents de la scène qui racontent quand même quelque chose. Un whoosh sur une transition, un impact grave sous un titre, un drone qui monte avant une révélation. Dans une pub ou une bande-annonce, cette couche porte souvent le rythme à elle seule.

Du texte vers le son, ou de l'image vers le son

Les outils se rangent en deux familles. Les générateurs texte vers audio fabriquent un son à partir d'une description : tu obtiens un fichier isolé, propre, que tu cales toi-même. Les modèles vidéo vers audio regardent ton plan et produisent une piste alignée sur les mouvements : moins de contrôle sur chaque son, mais une synchro gratuite. Les deux se complètent, et le bon réflexe consiste à choisir la famille selon la couche.

Faire le sound design d'une vidéo IA, étape par étape

Quelle couche avec quel outil. Fonctions et limites relevées dans les documentations officielles le 6 octobre 2026.
CoucheOutil adaptéCe qu'il fait bienSa limite
AmbianceElevenLabs Sound Effects, option boucleUn fond qui se répète sans début ni fin audibles30 secondes maximum par génération
SynchroMMAudio ou Kling Video to AudioLit le plan et cale le son sur les mouvementsMMAudio entraîné sur 8 secondes, poids non commerciaux
Synchro au rythme précisFirefly, Generate Sound effectsTa voix enregistrée donne le timing et l'intensitéÉditeur vidéo en bêta, prompts en anglais uniquement
DesignElevenLabs Sound EffectsWhoosh, impact, braam, drone sur commandeLe son est générique si le prompt l'est
Tout, en dépannageFreesoundDes sons enregistrés réels, gratuitsSeuls CC0 et CC BY autorisent l'usage commercial

Côté coûts, la documentation d'ElevenLabs indique 40 crédits par seconde quand tu fixes la durée, pour des effets de 0,1 à 30 secondes, avec un réglage d'influence du prompt et une option de boucle. Les 10 000 crédits mensuels de l'offre gratuite représentent donc environ quatre minutes de son, sans licence commerciale. L'offre Starter, à 6 dollars par mois, en donne 30 000 et ouvre l'usage commercial. Le reste de l'outil (voix, doublage, transcription) est détaillé dans le guide complet d'ElevenLabs.

Page Sound effects de la documentation ElevenLabs, avec la liste des usages dont la génération de Foley et d'ambiances pour la vidéo, et un lecteur audio d'exemple intitulé Cinematic braam
La page Sound effects de la documentation ElevenLabs, capturée sur elevenlabs.io le 6 octobre 2026.
  1. Regarde ton montage en muet et note chaque moment qui doit sonner, avec son timecode. Une porte à 0:07, des pas de 0:12 à 0:18, un titre à 0:31. C'est ton repérage. Sans cette liste, tu génères au hasard et tu payes des crédits pour des sons que tu ne poseras jamais.
  2. Coupe l'audio natif de tous les plans. Garde seulement les dialogues dont la synchro labiale est bonne, sur une piste à part.
  3. Pose l'ambiance en premier, sous toute la séquence. Une seule par lieu, en boucle si besoin. Si la scène change de lieu, fais un fondu d'une ambiance à l'autre sur une ou deux secondes plutôt qu'une coupe sèche.
  4. Ajoute la synchro plan par plan. Pour un plan court avec beaucoup de mouvement, passe-le dans un modèle vidéo vers audio. Pour un son isolé (une tasse, une clé), génère-le en texte avec la durée exacte et cale-le à la main sur l'image.
  5. Termine par le design, aux coupes et aux moments forts. Un whoosh sur une transition, un impact sur un titre. Ma règle perso : deux ou trois par minute au maximum, au-delà l'oreille ne les remarque plus.
  6. Mixe à l'oreille, voix au-dessus de tout. Baisse l'ambiance jusqu'à ne plus l'entendre consciemment, puis remonte-la d'un cran. Coupe-la ensuite deux secondes : si le plan te paraît soudain vide, elle est au bon niveau.

Pour la partie timeline, couper, empiler les pistes, faire les fondus, la méthode complète est dans l'article sur le montage d'une vidéo IA dans CapCut ou DaVinci Resolve. Si tu travailles déjà avec une animatique, fais le repérage dessus : les durées de plans sont fixées, tu peux générer les sons avant même d'avoir les plans finaux, comme expliqué dans la méthode de l'animatique IA.

> Pro Tip : écris tes prompts de bruitage dans l'ordre source, matière, action, espace. « Heavy leather boots walking slowly on wet gravel, outdoors, close perspective » sonne mieux que « footsteps in a forest ». J'écris en anglais : la doc d'ElevenLabs fournit son vocabulaire en anglais (Foley, ambience, whoosh, impact, one-shot, loop, braam, drone) et Firefly n'accepte que l'anglais pour ses effets.

Quand l'image dicte le son : MMAudio et Kling

MMAudio, publié à la conférence CVPR 2025, génère un son synchronisé à partir d'une vidéo, d'un texte ou des deux. Son dépôt GitHub annonce environ 6 Go de mémoire graphique en 16 bits, donc une carte récente suffit. Il a été entraîné sur des extraits de 8 secondes : au-delà, l'équipe prévient que la qualité peut baisser. Découpe tes plans longs avant de les lui donner.

Dépôt GitHub hkchengrex/MMAudio avec la description CVPR 2025 MMAudio, Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis, les tags text-to-audio et video-to-audio et la mention MIT license
Le dépôt officiel de MMAudio sur GitHub, capturé le 6 octobre 2026. La licence MIT affichée concerne le code, pas les poids du modèle.

Attention au piège de la licence, justement. Le code est sous MIT, mais les poids entraînés sont publiés sous CC-BY-NC 4.0, ce qui ferme la porte à l'usage commercial. Le README liste aussi ses propres défauts : des bruits qui ressemblent à de la parole inintelligible, de la musique de fond qui apparaît sans qu'on l'ait demandée, des difficultés sur les objets qu'il connaît mal. Écoute chaque sortie en entier avant de la poser.

Kling propose de son côté un outil Video to Audio et, depuis Kling 2.6, un audio natif généré en même temps que l'image. L'intérêt de l'outil séparé : il prend deux prompts distincts, un pour les effets et un pour la musique, ce qui évite de tout mélanger dans une seule piste. Les réglages vidéo du modèle sont dans le guide de Kling AI.

Donner le rythme avec ta voix : Firefly

Adobe a pris une autre voie. Dans l'éditeur vidéo de Firefly, encore en bêta, la fonction Generate Sound effects accepte un prompt texte et, en option, un enregistrement de ta voix. Tu places la tête de lecture sur l'image où le son doit commencer, tu fais « tchac, tchac, tchaaac » au micro pendant que la vidéo défile sans le son, et Firefly reprend le timing et l'intensité de ta voix pour générer l'effet.

Page d'aide Adobe Generate Sound effects, mise à jour le 16 juin 2026, expliquant la génération d'effets sonores dans l'éditeur vidéo de Firefly en bêta à partir d'un prompt texte et d'un enregistrement vocal pour le timing
L'aide officielle de Firefly sur la génération d'effets sonores, capturée sur helpx.adobe.com le 6 octobre 2026 (dernière mise à jour affichée : 16 juin 2026).

C'est la méthode la plus proche du vrai bruitage, celle où le geste humain décide du tempo. Elle a ses limites : prompts en anglais seulement, accès micro obligatoire, et un outil en bêta qui peut encore bouger. Pour une bagarre ou une pile d'objets qui s'effondre, c'est sur le papier la façon la plus directe d'obtenir un rythme qui ne sonne pas mécanique.

Les erreurs qui trahissent un son généré

Garder l'audio natif plan par plan

Le symptôme : à chaque coupe, la pièce change d'acoustique et le vent change de direction. Chaque plan a été généré seul, avec son propre fond. Pris un par un, ils sonnent bien, mais mis bout à bout, ils trahissent le montage.

Fix concret : coupe le fond natif, pose une seule ambiance par lieu sous toute la scène, et ne garde de l'audio natif que les dialogues bien synchronisés.

Demander toute la scène en une génération

Le symptôme : un prompt de trente secondes qui décrit pluie, pas, porte et voiture, et un résultat où tout se marche dessus. Impossible de baisser la pluie sans perdre la porte.

Fix concret : un son par génération, sur sa propre piste. Tu gardes la main sur le niveau et le calage de chacun, et tu ne regénères que celui qui ne va pas.

Oublier la licence du fichier

Le symptôme : la vidéo est livrée, le client la diffuse, et tu réalises que l'impact du titre sort d'un compte ElevenLabs gratuit, ou d'un son Freesound en CC BY-NC. Les deux interdisent l'usage commercial. Les poids de MMAudio aussi.

Fix concret : un fichier texte dans chaque dossier de projet, une ligne par son, avec l'outil, l'offre ou la licence, et la date. Le même réflexe vaut pour la musique, comme on l'a vu dans l'article sur les droits de la musique IA dans tes vidéos.

Faire sonner tout ce qui bouge

Le symptôme : chaque geste a son bruit, chaque transition son whoosh, et la vidéo devient fatigante au bout de quarante secondes. Les modèles vidéo vers audio y poussent facilement : ils ont tendance à donner un son à tout ce qui bouge dans le cadre.

Fix concret : reprends ton repérage et choisis. Un bruiteur de cinéma ne sonorise pas chaque mouvement, il garde ceux qui servent la scène. Si un son ne dit rien sur le personnage, l'espace ou le rythme, coupe-le.

FAQ

Quel outil choisir pour faire des bruitages avec l'IA ?

Pour un son isolé décrit en texte (une porte, un impact, une ambiance de café), ElevenLabs Sound Effects est le plus simple : tu écris, tu fixes la durée, tu télécharges. Pour un son qui doit coller aux mouvements d'un plan précis, un modèle vidéo vers audio comme MMAudio ou Kling Video to Audio analyse l'image et cale le son dessus. Firefly ajoute une option à part : tu enregistres ta voix pour donner le rythme.

Combien coûte un bruitage sur ElevenLabs ?

Selon la documentation d'ElevenLabs, un effet sonore coûte 40 crédits par seconde quand tu fixes toi-même la durée, avec un maximum de 30 secondes par génération. L'offre gratuite donne 10 000 crédits par mois, soit environ quatre minutes de son, mais sans licence commerciale. Celle-ci commence à l'offre Starter, 6 dollars par mois pour 30 000 crédits.

Peut-on utiliser MMAudio pour une vidéo commerciale ?

Pas avec les poids publiés. Le code de MMAudio est sous licence MIT, mais les modèles entraînés sont diffusés sur Hugging Face sous licence CC-BY-NC 4.0, qui interdit l'usage commercial. Tu peux t'en servir pour tester, maquetter ou produire un projet personnel. Pour un client, passe par un outil dont les conditions d'utilisation couvrent l'exploitation commerciale.

Faut-il garder l'audio natif de Veo ou de Kling ?

Garde-le comme repère, rarement comme son final. L'audio natif est généré plan par plan, donc l'ambiance change d'une coupe à l'autre et le montage s'entend. Les dialogues bien synchronisés peuvent rester. Pour le reste, coupe-le et reconstruis une ambiance continue sous toute la séquence, puis ajoute les bruitages qui comptent.

Comment écrire un bon prompt de bruitage ?

Décris la source, la matière, l'action et l'espace, dans cet ordre : « heavy leather boots walking slowly on wet gravel, outdoors, close perspective ». Ajoute un mot du vocabulaire son quand il aide (Foley, ambience, whoosh, impact, one-shot, loop). Fixe la durée exacte du plan. Plus tu nommes de matières, moins le son sort générique.

Où trouver des bruitages gratuits utilisables commercialement ?

Freesound reste la banque de référence, à condition de filtrer par licence. Seuls les sons en CC0 et en CC BY autorisent l'usage commercial, le second en créditant l'auteur. Les sons en CC BY-NC et Sampling+ sont exclus dès que ta vidéo te rapporte de l'argent. Note la licence de chaque fichier dans ton dossier de projet au moment où tu le télécharges.

Pour ta prochaine vidéo, commence petit : un seul plan de dix secondes, le son coupé, une ambiance, deux sons synchro, un effet. Compare avec la version d'origine, au casque. La différence s'entend tout de suite, et tu sauras ensuite où mettre ton temps sur les projets longs.

Note de fondateur : le son, c'est la moitié de la mise en scène qu'on oublie de travailler. Choisir ce qui doit s'entendre, ce qui doit se taire, et à quel moment, ça relève du même regard que le découpage d'une scène. C'est ce qu'on travaille dans la formation IA gratuite d'AI Studios.

Aller plus loin

Pour aller plus loin, j’ai préparé une formation gratuite qui montre comment structurer un vrai workflow IA pour créer des images et vidéos plus cinématiques.

Accéder à la formation gratuite

Vous voulez aller plus loin que de simples prompts ?

Découvrez la formation gratuite AI Studios pour apprendre à construire un vrai workflow image et vidéo avec l’IA.

Accéder à la formation gratuite

Articles liés