Créer ses bruitages et ses ambiances avec l’IA, et les garder à vie
Lecture : 13 min
Pour créer ses bruitages et ses ambiances sans catalogue payant, il y a trois gestes et une règle.
Tu récupères les sons déjà générés par d’autres dans la bibliothèque publique d’ElevenLabs, triés par nombre de téléchargements. Tu génères les tiens en respectant une seule règle : un son, une seule source.
Puis tu empiles 5 à 7 sons simples pour fabriquer une scène entière. Un café, une pluie sur la fenêtre, une vieille maison qui craque.
Le budget, c’est 6 $ pour un mois sur le plus petit abonnement, contre 18 € par mois ou plus de 200 € par an chez un catalogue classique.
Et la différence qui décide de tout : ce que tu génères pendant l’abonnement te reste après. Sur un catalogue, ce que tu publies une fois résilié n’est plus couvert. Là, tu fabriques. Ailleurs, tu loues.
Tu préfères regarder plutôt que lire ? La vidéo complète, avec les sons joués à l’écoute, est juste en dessous.
Le fond sonore ne décore pas, il crédibilise
Un son de fond n’est pas un ornement. Il change le jugement que ton spectateur porte sur ce que tu dis, et c’est mesuré.

Eryn Newman et Norbert Schwarz ont publié l’expérience en 2018 dans la revue Science Communication. Ils ont diffusé exactement le même contenu, des conférences filmées puis des interviews de l’émission Science Friday, en faisant varier une seule chose : la qualité audio. 97 participants sur la première expérience, 99 sur la seconde.
À contenu identique, l’audio dégradé a suffi. Les gens ont jugé le travail moins important, et l’orateur moins intelligent et moins sympathique.
Eryn Newman le résume ainsi : « Dès qu’on baissait la qualité audio, d’un coup, les scientifiques et leurs travaux perdaient en crédibilité. » Norbert Schwarz en donne le mécanisme : « Quand on rend l’information difficile à traiter, elle devient moins crédible. »
Un silence total entre tes phrases relève de la même famille de problèmes. Il ne dit rien de faux, il rend juste l’écoute inconfortable, et l’inconfort d’écoute se paie en confiance.
Ce que tu télécharges ne t’appartient jamais
Le réflexe, quand on manque de sons, c’est de chercher où en prendre. C’est le mauvais réflexe, parce que les deux voies classiques ont chacune un défaut que personne n’annonce à l’entrée.
Le gratuit ne protège pas. J’ai téléchargé un morceau sur Pixabay, sous licence libre de droits, licence que j’ai gardée. Je me suis quand même pris une revendication YouTube dessus, et elle est toujours là.

Ce n’est même pas l’auteur qui l’a déposée, c’est un intermédiaire qui a inscrit le morceau dans la détection automatique de YouTube. Ta licence ne vaut rien contre un système qui ne la lit pas.
Le payant ne te donne rien. En dessous de 18 € par mois, ou 200 € par an, l’offre sérieuse commence à peine. Et ce que tu paies, ce n’est pas le fichier, c’est le droit de t’en servir pendant que tu paies.

Epidemic Sound l’écrit sur sa page de licence : « Tout contenu publié dans le cadre d’un abonnement actif reste clearé indéfiniment. » Puis, dans la phrase suivante : « L’utilisation de la musique d’Epidemic Sound dans du nouveau contenu publié après la fin de votre abonnement entraînera la monétisation par Epidemic Sound et des revendications de droits d’auteur. »
Tes anciennes vidéos restent en ligne. Mais le jour où tu arrêtes de payer, ta banque cesse d’exister pour tout ce que tu publieras ensuite.
En 2019, c’était plus serré encore : chaque morceau arrivait avec son propre contrat, à mon nom, et le nom de la vidéo écrit dedans.

Une licence, un fichier, une vidéo. Le modèle a l’air d’avoir changé, mais le principe est resté : tu n’achètes pas un son, tu loues une autorisation.
Où récupérer des sons déjà bons, sans dépenser un crédit
La partie la plus utile d’ElevenLabs n’est pas le générateur, c’est la bibliothèque publique de ce que les autres ont déjà généré. Dans Sound Effects, l’onglet Explorer donne accès à tout, avec un tri par nombre de téléchargements.

Ce tri fait un travail que tu ne peux pas faire seul : les plus téléchargés sont presque toujours les meilleurs. Des milliers d’oreilles ont voté avant toi.
Sur un simple whoosh, ce son de transition qui ressemble à un coup de fouet, j’en ai trouvé un à 2 600 téléchargements et un autre à 1 700.
Le vrai bonus est ailleurs. Le prompt qui a produit le son est affiché, en entier.

Sur celui-là, la personne a écrit « comme la version 4, mais plus doux et plus lent, 350 ms ». Elle en était donc au moins à son quatrième essai. Tu récupères le son ET les quatre itérations qu’il a fallu pour l’obtenir.
Un réglage à cocher systématiquement : le bouclage, un raccord invisible entre la fin et le début du son. Indispensable pour une ambiance qui tourne sous une voix. À savoir, une génération plafonne à 30 secondes.
L’option sans crédit ni abonnement
YouTube Studio a sa propre bibliothèque audio, avec des musiques et des effets sonores. Rien à installer, rien à payer.

Le catalogue est très restreint. Sur les sons de whoosh, par exemple, il y en a trois. Trois.
Et le défaut est structurel : tout le monde y puise. Un son déjà entendu chez dix autres créateurs ne construit rien pour toi. C’est un dépannage, pas une banque.
La règle qui décide de tout : une source à la fois
J’avais tout pour réussir mes propres ambiances. Je savais quels sons étaient bons, grâce aux téléchargements, et j’avais le prompt exact qui les avait produits.
J’ai relancé le prompt d’une ambiance de forêt cinq fois, puis je me suis fait rejouer les cinq versions à l’aveugle, de A à E, sans savoir laquelle était l’originale.

Une seule tenait la route : la B. C’était le son téléchargé. Mes quatre générations, avec le même prompt, sortaient toutes abîmées, un grésillement de branches secouées et des oiseaux à la voix synthétique.
Ce prompt demandait des oiseaux, du vent, du bruissement de feuilles et de l’écho lointain. Quatre sources sonores simultanées. C’est là que le modèle décroche.
Le contre-test le prouve. Un whoosh, une seule source, un geste unique.

Trois générations, trois résultats différents, trois résultats utilisables.
Demande une seule source à la fois. Une scène complète en un prompt, c’est une loterie : un résultat correct sur vingt tirages, et tes crédits partis dans les dix-neuf autres.
Cette règle change aussi la façon de lire la bibliothèque. Une ambiance complexe avec beaucoup de téléchargements n’est presque jamais la preuve d’un bon prompt. C’est un survivant, le tirage gagnant d’une série d’échecs que personne n’a publiés.
Fabriquer un lieu : la scène en couches
Si une bonne génération ne contient qu’une source, un café entier ne se demande pas. Il s’assemble.
Un café, ce n’est pas un bruit de tasse. C’est la machine expresso qui tourne par intermittence, une porte qui claque au loin, des murmures, une chaise qui bouge.

Chaque couche est un son simple, donc chaque couche se génère bien. C’est leur superposition qui fabrique le lieu, pas le talent du prompt. De 5 à 7 sons est la bonne fourchette : en dessous ça sonne pauvre, au-dessus ça devient une bouillie, je m’en suis rendu compte en surchargeant un vaisseau spatial.
Une ambiance téléchargée toute faite, à l’inverse, est un bloc figé : le seul réglage disponible est le volume général. Tu ne peux ni reculer les murmures, ni faire claquer la porte moins souvent, ni retirer une couche six mois plus tard.
C’est pour ça que je me suis fait fabriquer une console : un curseur de fréquence et un curseur de volume par son. Chaque couche reste vivante et réglable, et une recette peut être remixée plus tard.

J’en ai fait la pluie sur la fenêtre, un vaisseau spatial, une vieille maison qui craque, un jardin japonais, un scriptorium que je laisse tourner pour travailler. Chacune est à moi, réutilisable autant de fois que je veux.
Ce que l’IA rate encore
Il y a une catégorie de sons où ces modèles échouent, et la connaître évite de brûler des crédits pour rien.
Je suis biologiste de formation, alors j’ai testé des espèces précises.

Ces modèles ont été massivement entraînés sur les oiseaux et très peu sur les insectes, qui sont mauvais. Et les oiseaux ne tiennent que si l’auditeur ne connaît pas le chant : le coucou a la note, mais pas le phrasé, ce qui donne un coucou en mauvaise santé.
Le test décisif reste la cigale méditerranéenne, un son que tout le monde a en mémoire. Même en écrivant explicitement que j’en voulais une seule, j’obtiens une nuée entière avec un bourdonnement électrique derrière.
La règle dépasse largement les animaux. Un son que ton spectateur connaît par cœur, il entendra que c’est faux. Ça vaut pour le véhicule emblématique de ta ville comme pour une signature sonore de marque, que tu n’aurais de toute façon pas le droit de reprendre.
Prends du générique : une vieille maison qui craque a mille versions plausibles, et aucune ne peut être démentie.
Le dosage : deux niveaux pour tes bruitages et tes ambiances
L’erreur la plus fréquente ne vient pas de la génération, elle vient du montage. On pose une ambiance au volume où on l’entend bien pendant qu’on travaille, et c’est déjà beaucoup trop fort.

Une ambiance se règle autour de moins 45 décibels, à ajuster selon ton logiciel, c’est-à-dire à la limite du perceptible. On ne doit pas l’entendre, on doit sentir que la pièce a un volume. Ta voix porte l’information, le fond porte l’espace.
Un bruitage obéit à la règle inverse. Un whoosh sur une transition, un son court qui annonce l’arrivée de quelque chose, doit s’entendre franchement, sinon il ne remplit pas sa fonction d’attention.
Deux réglages opposés, donc, et c’est le point qu’on rate le plus souvent : l’ambiance à peine audible, le bruitage bien présent.
Si tu montes déjà tes Reels et tes Shorts avec l’IA, ces sons se posent dans le même flux de travail. J’ai détaillé le sous-titrage dans l’article sur les sous-titres animés sans CapCut, et l’habillage dans celui sur animer ses vidéos sans After Effects.
Ce que tu as vraiment le droit d’en faire
C’est la partie que personne ne traite, et c’est celle qui coûte le plus cher quand on se trompe. Elle tient en trois points.
Ce que tu génères te reste. Les conditions d’utilisation d’ElevenLabs sont explicites : « you retain all rights in and to your Output ». Tu conserves tes droits sur ta production.

En pratique : le plan Starter à 6 $ par mois est le premier palier à porter la licence commerciale, avec 30 000 crédits. Un mois suffit à te constituer une banque réutilisable ensuite dans tous tes contenus, résiliation comprise. C’est sur leur site, et c’est un lien affilié : si tu prends un abonnement, je touche une commission d’ElevenLabs, sans un centime de plus pour toi. Ça ne change rien à ce que je te conseille, à commencer par prendre le plan le moins cher et résilier une fois ta banque faite.
Piège à éviter : acheter uniquement des crédits via la partie API ne donne pas la licence.
Sans abonnement, c’est possible avec une contrepartie. Le plan gratuit peut télécharger les sons publics à condition de créditer elevenlabs.io ; les plans payants retirent cette obligation et ouvrent l’usage commercial. Pour quelqu’un qui monétise, la question est tranchée d’avance.
Revendre des packs est interdit. ElevenLabs demande de ne pas vendre ni licencier ses outils, ni d’utiliser les sorties pour développer un produit concurrent. Ces sons habillent tes contenus, ils n’ouvrent pas une boutique.
Pourquoi je sépare la musique des ambiances
Tout ce qui précède ne parle jamais de musique, et c’est volontaire.

Une musique porte une mélodie, et c’est la mélodie que la détection automatique sait reconnaître. Une IA peut produire une ligne proche d’un morceau existant sans que tu t’en aperçoives. Une porte qui craque, des murmures, de la pluie ne ressemblent à rien de déposé.
J’ai une chaîne YouTube, Libreneur Ambience, que je n’alimente plus, sur laquelle j’ai généré des musiques avec mélodie par IA pendant des mois, sans jamais recevoir la moindre revendication. Le risque est donc faible. Je garde quand même les deux mondes séparés : la précaution ne coûte rien, la revendication si.
Une signature sonore, et c’est là que ça devient intéressant
Sur Instagram, tout le monde pose la même musique du moment pour gratter un peu de portée. C’est exactement le contraire d’une identité.

Quand tu fabriques tes ambiances, tu ne choisis plus dans un catalogue commun. Tu choisis ce qui te parle : l’endroit où tu as grandi, les lieux que tu aimes, ce que tu veux entendre en travaillant. Mes scènes ne ressemblent à celles de personne, parce que personne d’autre n’aurait assemblé ce mélange.
C’est la même logique que la banque de visuels personnelle dont je parlais dans l’article sur chercher dans ses photos par description. La matière qui est à toi bat la matière que tout le monde peut télécharger.
La console que j’ai fabriquée pour doser mes ambiances couche par couche est en téléchargement gratuit dans ma communauté, avec le fichier de conseils qui va avec. Elle fonctionne avec et sans Claude Code.

Elle est dans le post consacré à cette vidéo, avec le fichier de conseils. C’est gratuit, il suffit de s’inscrire à la Tribu.
Questions fréquentes
Les sons générés par l’IA sont-ils libres de droits ?
Pas au sens des banques gratuites. Ce que tu génères sur ElevenLabs est couvert par une licence commerciale à partir du plan Starter, à 6 $ par mois. Sur le plan gratuit, tu peux télécharger les sons publics, mais tu dois créditer elevenlabs.io.
Est-ce que je garde mes sons si j’arrête l’abonnement ?
Oui, pour tout ce qui a été généré pendant un abonnement payant : les conditions précisent que tu conserves tes droits sur ta production. C’est la différence de fond avec un catalogue comme Epidemic Sound, où ce que tu publies après la résiliation n’est plus couvert.

Peut-on revendre des packs de bruitages générés par IA ?
Non. ElevenLabs demande explicitement de ne pas vendre ou licencier ses outils, ni d’utiliser les sorties pour créer un produit ou un service concurrent.
À quel volume poser une ambiance sous une voix ?
Autour de moins 45 décibels, c’est-à-dire à la limite de l’audible. Si tu l’entends distinctement au montage, elle est trop forte. Les bruitages courts, eux, doivent s’entendre volontairement.
Pourquoi mes générations sont moins bonnes que le son d’origine, avec le même prompt ?
Parce que ce prompt demande sans doute plusieurs sources à la fois. La génération devient aléatoire, et le son très téléchargé que tu as sous les yeux est le meilleur tirage d’une longue série. Demande une seule source.
Pourquoi une revendication YouTube sur un son libre de droits ?
Parce qu’un intermédiaire peut inscrire un morceau dans la détection automatique de YouTube même si ta licence est valide. C’est ce qui m’est arrivé sur un son Pixabay. Les ambiances sans mélodie n’ont pratiquement pas ce risque.
Sources
- Eryn Newman et Norbert Schwarz, Good Sound, Good Research: How Audio Quality Influences Perceptions of the Research and Researcher, Science Communication, mars 2018 · résumé USC Dornsife · dépôt de recherche ANU
- Tarifs ElevenLabs et conditions d’utilisation
- Bibliothèque publique d’effets sonores ElevenLabs
- Documentation ElevenLabs sur les effets sonores
- Page licence d’Epidemic Sound
Un autre article pourrait t'intéresser



