Accueil » Tech & Innovations » Créer ses bruitages et ses ambiances avec l’IA, et les garder à vie

Créer ses bruitages et ses ambiances avec l’IA, et les garder à vie

creer-ses-bruitages-et-ambiances-avec-lia

Lecture : 13 min

Pour créer ses bruitages et ses ambiances sans catalogue payant, il y a trois gestes et une règle.

Tu récupères les sons déjà générés par d’autres dans la bibliothèque publique d’ElevenLabs, triés par nombre de téléchargements. Tu génères les tiens en respectant une seule règle : un son, une seule source.

Puis tu empiles 5 à 7 sons simples pour fabriquer une scène entière. Un café, une pluie sur la fenêtre, une vieille maison qui craque.

Le budget, c’est 6 $ pour un mois sur le plus petit abonnement, contre 18 € par mois ou plus de 200 € par an chez un catalogue classique.

Et la différence qui décide de tout : ce que tu génères pendant l’abonnement te reste après. Sur un catalogue, ce que tu publies une fois résilié n’est plus couvert. Là, tu fabriques. Ailleurs, tu loues.

Tu préfères regarder plutôt que lire ? La vidéo complète, avec les sons joués à l’écoute, est juste en dessous.

La vidéo complète : la bibliothèque, les tests à l’aveugle, la console et les droits.

Le fond sonore ne décore pas, il crédibilise

Un son de fond n’est pas un ornement. Il change le jugement que ton spectateur porte sur ce que tu dis, et c’est mesuré.

Une onde sonore vivante à gauche et à droite, plate et morte au centre
Entre deux phrases, la piste ne contient rien. Ce n’est pas neutre pour l’oreille de celui qui t’écoute.

Eryn Newman et Norbert Schwarz ont publié l’expérience en 2018 dans la revue Science Communication. Ils ont diffusé exactement le même contenu, des conférences filmées puis des interviews de l’émission Science Friday, en faisant varier une seule chose : la qualité audio. 97 participants sur la première expérience, 99 sur la seconde.

À contenu identique, l’audio dégradé a suffi. Les gens ont jugé le travail moins important, et l’orateur moins intelligent et moins sympathique.

Eryn Newman le résume ainsi : « Dès qu’on baissait la qualité audio, d’un coup, les scientifiques et leurs travaux perdaient en crédibilité. » Norbert Schwarz en donne le mécanisme : « Quand on rend l’information difficile à traiter, elle devient moins crédible. »

Un silence total entre tes phrases relève de la même famille de problèmes. Il ne dit rien de faux, il rend juste l’écoute inconfortable, et l’inconfort d’écoute se paie en confiance.

Ce que tu télécharges ne t’appartient jamais

Le réflexe, quand on manque de sons, c’est de chercher où en prendre. C’est le mauvais réflexe, parce que les deux voies classiques ont chacune un défaut que personne n’annonce à l’entrée.

Le gratuit ne protège pas. J’ai téléchargé un morceau sur Pixabay, sous licence libre de droits, licence que j’ai gardée. Je me suis quand même pris une revendication YouTube dessus, et elle est toujours là.

Une revendication de droits d'auteur sur une vidéo YouTube
La revendication reçue sur un son téléchargé en libre de droits, licence à l’appui. Ce n’est même pas l’auteur qui l’a déposée.

Ce n’est même pas l’auteur qui l’a déposée, c’est un intermédiaire qui a inscrit le morceau dans la détection automatique de YouTube. Ta licence ne vaut rien contre un système qui ne la lit pas.

Le payant ne te donne rien. En dessous de 18 € par mois, ou 200 € par an, l’offre sérieuse commence à peine. Et ce que tu paies, ce n’est pas le fichier, c’est le droit de t’en servir pendant que tu paies.

Une onde sonore qui se désintègre en particules au passage d'une frontière
Le modèle des catalogues : la licence couvre ce que tu as publié pendant l’abonnement, et s’arrête net pour tout ce qui vient après.

Epidemic Sound l’écrit sur sa page de licence : « Tout contenu publié dans le cadre d’un abonnement actif reste clearé indéfiniment. » Puis, dans la phrase suivante : « L’utilisation de la musique d’Epidemic Sound dans du nouveau contenu publié après la fin de votre abonnement entraînera la monétisation par Epidemic Sound et des revendications de droits d’auteur. »

Tes anciennes vidéos restent en ligne. Mais le jour où tu arrêtes de payer, ta banque cesse d’exister pour tout ce que tu publieras ensuite.

En 2019, c’était plus serré encore : chaque morceau arrivait avec son propre contrat, à mon nom, et le nom de la vidéo écrit dedans.

Un contrat de licence nominatif, valable pour une seule vidéo nommée dedans
Le contrat de 2019, à mon nom, avec le titre de la vidéo écrit à l’intérieur. Une licence, un fichier, une vidéo.

Une licence, un fichier, une vidéo. Le modèle a l’air d’avoir changé, mais le principe est resté : tu n’achètes pas un son, tu loues une autorisation.

Où récupérer des sons déjà bons, sans dépenser un crédit

La partie la plus utile d’ElevenLabs n’est pas le générateur, c’est la bibliothèque publique de ce que les autres ont déjà généré. Dans Sound Effects, l’onglet Explorer donne accès à tout, avec un tri par nombre de téléchargements.

La bibliothèque publique de sons générés, triée par nombre de téléchargements
L’onglet Explorer d’ElevenLabs, trié par nombre de téléchargements. Le tri a déjà été fait par des milliers d’utilisateurs.

Ce tri fait un travail que tu ne peux pas faire seul : les plus téléchargés sont presque toujours les meilleurs. Des milliers d’oreilles ont voté avant toi.

Sur un simple whoosh, ce son de transition qui ressemble à un coup de fouet, j’en ai trouvé un à 2 600 téléchargements et un autre à 1 700.

Le vrai bonus est ailleurs. Le prompt qui a produit le son est affiché, en entier.

Le prompt complet d'un son public, qui mentionne un quatrième essai
Le prompt complet est affiché. Celui-ci dit « comme la version 4, mais plus doux et plus lent » : quatre essais déjà payés par quelqu’un d’autre.

Sur celui-là, la personne a écrit « comme la version 4, mais plus doux et plus lent, 350 ms ». Elle en était donc au moins à son quatrième essai. Tu récupères le son ET les quatre itérations qu’il a fallu pour l’obtenir.

Un réglage à cocher systématiquement : le bouclage, un raccord invisible entre la fin et le début du son. Indispensable pour une ambiance qui tourne sous une voix. À savoir, une génération plafonne à 30 secondes.

L’option sans crédit ni abonnement

YouTube Studio a sa propre bibliothèque audio, avec des musiques et des effets sonores. Rien à installer, rien à payer.

La bibliothèque audio de YouTube Studio
La bibliothèque audio de YouTube Studio : gratuite, mais très restreinte et utilisée par tout le monde.

Le catalogue est très restreint. Sur les sons de whoosh, par exemple, il y en a trois. Trois.

Et le défaut est structurel : tout le monde y puise. Un son déjà entendu chez dix autres créateurs ne construit rien pour toi. C’est un dépannage, pas une banque.

La règle qui décide de tout : une source à la fois

J’avais tout pour réussir mes propres ambiances. Je savais quels sons étaient bons, grâce aux téléchargements, et j’avais le prompt exact qui les avait produits.

J’ai relancé le prompt d’une ambiance de forêt cinq fois, puis je me suis fait rejouer les cinq versions à l’aveugle, de A à E, sans savoir laquelle était l’originale.

Cinq ambiances de forêt jouées à l'aveugle, une seule est propre
Cinq ambiances de forêt jouées à l’aveugle, de A à E. Une seule était propre, et c’était l’originale téléchargée.

Une seule tenait la route : la B. C’était le son téléchargé. Mes quatre générations, avec le même prompt, sortaient toutes abîmées, un grésillement de branches secouées et des oiseaux à la voix synthétique.

Ce prompt demandait des oiseaux, du vent, du bruissement de feuilles et de l’écho lointain. Quatre sources sonores simultanées. C’est là que le modèle décroche.

Le contre-test le prouve. Un whoosh, une seule source, un geste unique.

Trois générations d'un whoosh, toutes exploitables
Le même test sur un whoosh, une seule source : les trois générations sont différentes et toutes les trois exploitables.

Trois générations, trois résultats différents, trois résultats utilisables.

Demande une seule source à la fois. Une scène complète en un prompt, c’est une loterie : un résultat correct sur vingt tirages, et tes crédits partis dans les dix-neuf autres.

Cette règle change aussi la façon de lire la bibliothèque. Une ambiance complexe avec beaucoup de téléchargements n’est presque jamais la preuve d’un bon prompt. C’est un survivant, le tirage gagnant d’une série d’échecs que personne n’a publiés.

Fabriquer un lieu : la scène en couches

Si une bonne génération ne contient qu’une source, un café entier ne se demande pas. Il s’assemble.

Un café, ce n’est pas un bruit de tasse. C’est la machine expresso qui tourne par intermittence, une porte qui claque au loin, des murmures, une chaise qui bouge.

Les couches sonores qui composent une ambiance de café
Un café, ce n’est pas un bruit de tasse. C’est la machine expresso, une porte au loin, des murmures, une chaise qui bouge.

Chaque couche est un son simple, donc chaque couche se génère bien. C’est leur superposition qui fabrique le lieu, pas le talent du prompt. De 5 à 7 sons est la bonne fourchette : en dessous ça sonne pauvre, au-dessus ça devient une bouillie, je m’en suis rendu compte en surchargeant un vaisseau spatial.

Une ambiance téléchargée toute faite, à l’inverse, est un bloc figé : le seul réglage disponible est le volume général. Tu ne peux ni reculer les murmures, ni faire claquer la porte moins souvent, ni retirer une couche six mois plus tard.

C’est pour ça que je me suis fait fabriquer une console : un curseur de fréquence et un curseur de volume par son. Chaque couche reste vivante et réglable, et une recette peut être remixée plus tard.

Trois ambiances fabriquées avec la même méthode
Trois scènes fabriquées avec la même méthode : la pluie sur la fenêtre, un vaisseau spatial, une vieille maison qui craque.

J’en ai fait la pluie sur la fenêtre, un vaisseau spatial, une vieille maison qui craque, un jardin japonais, un scriptorium que je laisse tourner pour travailler. Chacune est à moi, réutilisable autant de fois que je veux.

Ce que l’IA rate encore

Il y a une catégorie de sons où ces modèles échouent, et la connaître évite de brûler des crédits pour rien.

Je suis biologiste de formation, alors j’ai testé des espèces précises.

Le banc de test des espèces : mammifères, oiseaux, insectes
Le banc de test des espèces. Les mammifères passent, les insectes non, et la cigale méditerranéenne reste impossible à obtenir seule.

Ces modèles ont été massivement entraînés sur les oiseaux et très peu sur les insectes, qui sont mauvais. Et les oiseaux ne tiennent que si l’auditeur ne connaît pas le chant : le coucou a la note, mais pas le phrasé, ce qui donne un coucou en mauvaise santé.

Le test décisif reste la cigale méditerranéenne, un son que tout le monde a en mémoire. Même en écrivant explicitement que j’en voulais une seule, j’obtiens une nuée entière avec un bourdonnement électrique derrière.

La règle dépasse largement les animaux. Un son que ton spectateur connaît par cœur, il entendra que c’est faux. Ça vaut pour le véhicule emblématique de ta ville comme pour une signature sonore de marque, que tu n’aurais de toute façon pas le droit de reprendre.

Prends du générique : une vieille maison qui craque a mille versions plausibles, et aucune ne peut être démentie.

Le dosage : deux niveaux pour tes bruitages et tes ambiances

L’erreur la plus fréquente ne vient pas de la génération, elle vient du montage. On pose une ambiance au volume où on l’entend bien pendant qu’on travaille, et c’est déjà beaucoup trop fort.

Le repère de niveau pour poser une ambiance sous une voix
Le repère de niveau : autour de moins 45 décibels, l’ambiance doit être à peine audible sous la voix.

Une ambiance se règle autour de moins 45 décibels, à ajuster selon ton logiciel, c’est-à-dire à la limite du perceptible. On ne doit pas l’entendre, on doit sentir que la pièce a un volume. Ta voix porte l’information, le fond porte l’espace.

Un bruitage obéit à la règle inverse. Un whoosh sur une transition, un son court qui annonce l’arrivée de quelque chose, doit s’entendre franchement, sinon il ne remplit pas sa fonction d’attention.

Deux réglages opposés, donc, et c’est le point qu’on rate le plus souvent : l’ambiance à peine audible, le bruitage bien présent.

Si tu montes déjà tes Reels et tes Shorts avec l’IA, ces sons se posent dans le même flux de travail. J’ai détaillé le sous-titrage dans l’article sur les sous-titres animés sans CapCut, et l’habillage dans celui sur animer ses vidéos sans After Effects.

Ce que tu as vraiment le droit d’en faire

C’est la partie que personne ne traite, et c’est celle qui coûte le plus cher quand on se trompe. Elle tient en trois points.

Ce que tu génères te reste. Les conditions d’utilisation d’ElevenLabs sont explicites : « you retain all rights in and to your Output ». Tu conserves tes droits sur ta production.

Le plan d'entrée à 6 dollars par mois, licence commerciale incluse
Le plan Starter à 6 dollars par mois : licence commerciale incluse, et ce qui est généré pendant l’abonnement reste utilisable après.

En pratique : le plan Starter à 6 $ par mois est le premier palier à porter la licence commerciale, avec 30 000 crédits. Un mois suffit à te constituer une banque réutilisable ensuite dans tous tes contenus, résiliation comprise. C’est sur leur site, et c’est un lien affilié : si tu prends un abonnement, je touche une commission d’ElevenLabs, sans un centime de plus pour toi. Ça ne change rien à ce que je te conseille, à commencer par prendre le plan le moins cher et résilier une fois ta banque faite.

Piège à éviter : acheter uniquement des crédits via la partie API ne donne pas la licence.

Sans abonnement, c’est possible avec une contrepartie. Le plan gratuit peut télécharger les sons publics à condition de créditer elevenlabs.io ; les plans payants retirent cette obligation et ouvrent l’usage commercial. Pour quelqu’un qui monétise, la question est tranchée d’avance.

Revendre des packs est interdit. ElevenLabs demande de ne pas vendre ni licencier ses outils, ni d’utiliser les sorties pour développer un produit concurrent. Ces sons habillent tes contenus, ils n’ouvrent pas une boutique.

Pourquoi je sépare la musique des ambiances

Tout ce qui précède ne parle jamais de musique, et c’est volontaire.

La différence entre une musique et une ambiance face à la détection automatique
Une musique porte une mélodie, donc elle est reconnaissable par la détection automatique. Une ambiance, non.

Une musique porte une mélodie, et c’est la mélodie que la détection automatique sait reconnaître. Une IA peut produire une ligne proche d’un morceau existant sans que tu t’en aperçoives. Une porte qui craque, des murmures, de la pluie ne ressemblent à rien de déposé.

J’ai une chaîne YouTube, Libreneur Ambience, que je n’alimente plus, sur laquelle j’ai généré des musiques avec mélodie par IA pendant des mois, sans jamais recevoir la moindre revendication. Le risque est donc faible. Je garde quand même les deux mondes séparés : la précaution ne coûte rien, la revendication si.

Une signature sonore, et c’est là que ça devient intéressant

Sur Instagram, tout le monde pose la même musique du moment pour gratter un peu de portée. C’est exactement le contraire d’une identité.

Une onde sonore qui se referme en empreinte digitale
Une banque fabriquée finit par ne ressembler qu’à toi, parce que personne d’autre n’aurait choisi le même assemblage.

Quand tu fabriques tes ambiances, tu ne choisis plus dans un catalogue commun. Tu choisis ce qui te parle : l’endroit où tu as grandi, les lieux que tu aimes, ce que tu veux entendre en travaillant. Mes scènes ne ressemblent à celles de personne, parce que personne d’autre n’aurait assemblé ce mélange.

C’est la même logique que la banque de visuels personnelle dont je parlais dans l’article sur chercher dans ses photos par description. La matière qui est à toi bat la matière que tout le monde peut télécharger.

La console que j’ai fabriquée pour doser mes ambiances couche par couche est en téléchargement gratuit dans ma communauté, avec le fichier de conseils qui va avec. Elle fonctionne avec et sans Claude Code.

La console : un curseur de fréquence et de volume par son
La console : chaque son a son propre curseur de fréquence et de volume, et la recette se remixe autant de fois qu’on veut.

Récupérer la console

Elle est dans le post consacré à cette vidéo, avec le fichier de conseils. C’est gratuit, il suffit de s’inscrire à la Tribu.

Questions fréquentes

Les sons générés par l’IA sont-ils libres de droits ?

Pas au sens des banques gratuites. Ce que tu génères sur ElevenLabs est couvert par une licence commerciale à partir du plan Starter, à 6 $ par mois. Sur le plan gratuit, tu peux télécharger les sons publics, mais tu dois créditer elevenlabs.io.

Est-ce que je garde mes sons si j’arrête l’abonnement ?

Oui, pour tout ce qui a été généré pendant un abonnement payant : les conditions précisent que tu conserves tes droits sur ta production. C’est la différence de fond avec un catalogue comme Epidemic Sound, où ce que tu publies après la résiliation n’est plus couvert.

Ce qui reste à toi, pour toujours
Ce qui reste à toi, pour toujours : le point qui sépare une banque fabriquée d’un catalogue loué.

Peut-on revendre des packs de bruitages générés par IA ?

Non. ElevenLabs demande explicitement de ne pas vendre ou licencier ses outils, ni d’utiliser les sorties pour créer un produit ou un service concurrent.

À quel volume poser une ambiance sous une voix ?

Autour de moins 45 décibels, c’est-à-dire à la limite de l’audible. Si tu l’entends distinctement au montage, elle est trop forte. Les bruitages courts, eux, doivent s’entendre volontairement.

Pourquoi mes générations sont moins bonnes que le son d’origine, avec le même prompt ?

Parce que ce prompt demande sans doute plusieurs sources à la fois. La génération devient aléatoire, et le son très téléchargé que tu as sous les yeux est le meilleur tirage d’une longue série. Demande une seule source.

Pourquoi une revendication YouTube sur un son libre de droits ?

Parce qu’un intermédiaire peut inscrire un morceau dans la détection automatique de YouTube même si ta licence est valide. C’est ce qui m’est arrivé sur un son Pixabay. Les ambiances sans mélodie n’ont pratiquement pas ce risque.

Rejoindre la Tribu

Sources

Marc-Antoine Richard

Marc-Antoine Richard, fondateur de Libreneur. Écologue de formation devenu expert web, il teste depuis 2014 les outils, l'automatisation et l'IA pour aider les solopreneurs à créer du contenu sans y laisser leur temps ni leur énergie. Il partage ses méthodes sur YouTube et dans la Tribu des Libreneurs.

Un autre article pourrait t'intéresser