Guides Imọlẹ Parcours23 / 88
Apprendre l’IA · Leçon 11/17

Qu’est-ce qu’un modèle audio ?

Découvrez comment un modèle traite le son et distinguez voix, transcription, musique, effets sonores, doublage et isolation.

Introduction à l’IA Durée indicative · 40 minutes

Objectifs de la leçon

Expliquer comment un son devient une donnée numérique.

Comprendre comment un modèle audio apprend et génère.

Distinguer les principales familles de modèles audio.

Reconnaître les limites liées à la langue, l’accent, le bruit et la représentation des voix.

Le son est une vibration enregistrée dans le temps

Le son est une vibration enregistrée dans le temps

Le son commence par des vibrations qui se déplacent dans l’air. Un microphone transforme ces vibrations en signal électrique. Un ordinateur mesure ensuite ce signal de nombreuses fois par seconde et enregistre les mesures sous forme de nombres.

Une forme d’onde montre comment le signal change dans le temps. De grandes ondes correspondent généralement à un son plus fort. Des répétitions rapides sont associées aux fréquences aiguës et des répétitions lentes aux fréquences graves. La parole humaine combine de nombreuses fréquences en même temps.

Un fichier audio possède aussi une fréquence d’échantillonnage, un nombre de canaux, une durée et un format d’encodage. Ces choix influencent la qualité, le poids du fichier, la compatibilité et la quantité de détails disponible pour le modèle.

Forme d’onde Forme d’onde

Une représentation de la force du signal dans le temps.

Les pauses apparaissent comme des zones calmes entre les phrases.
Fréquence Fréquence

La vitesse de répétition d’une vibration, mesurée en hertz.

Une voix grave contient généralement davantage de basses fréquences.
Fréquence d’échantillonnage Fréquence d’échantillonnage

Le nombre de mesures du signal enregistrées chaque seconde.

Un fichier vocal à 24 kHz enregistre 24 000 mesures par seconde.
Canal Canal

Un signal audio enregistré séparément.

Le mono utilise un canal ; la stéréo utilise un canal gauche et un canal droit.
Cas pratique Un enregistrement clair en studio

Un enregistrement clair en studio

Situation

Une personne parle près d’un bon microphone dans une pièce calme. La forme d’onde contient une voix forte et peu de sons concurrents.

À retenir

Une source claire fournit davantage d’informations utiles aux modèles de transcription, clonage et isolation.

Cas pratique Un entretien dans un marché bruyant

Un entretien dans un marché bruyant

Situation

Plusieurs personnes parlent pendant que motos, musique, vent et clients occupent des fréquences proches. Le modèle doit séparer des signaux qui se chevauchent avant de reconnaître les mots.

À retenir

La langue peut être prise en charge alors que les conditions d’enregistrement restent difficiles.

Comment un modèle audio apprend

Comment un modèle audio apprend

Un modèle audio est entraîné avec des enregistrements et des informations associées : transcriptions, identités de locuteurs, langues, émotions, descriptions musicales, étiquettes de sons ou versions propre et bruitée d’un même enregistrement.

Le système peut transformer la forme d’onde en spectrogramme, qui montre l’évolution des fréquences dans le temps, ou en tokens audio compressés. Le modèle apprend ensuite les relations entre sons, mots, locuteurs, instruments, émotions ou événements.

Un modèle de transcription prédit du texte à partir du son. Un modèle vocal prédit un audio à partir d’un texte et d’instructions de voix. Un modèle musical prédit une séquence sonore musicale. L’entraînement compare régulièrement la prédiction au résultat attendu et ajuste le modèle.

Le cycle simplifié de l’entraînement audio
ÉtapeCe qui se passeExemple
1. Préparer les enregistrementsDes audios et informations utiles sont réunis.Une voix avec sa transcription exacte et sa langue.
2. Représenter le sonLe signal devient fréquences, caractéristiques ou tokens audio.Le modèle peut traiter numériquement la prononciation et le rythme.
3. PrédireLe modèle tente de produire du texte ou un son.Prédire la phrase prononcée dans l’enregistrement.
4. ComparerLa prédiction est comparée au résultat attendu.Un nom ou une syllabe peut être incorrect.
5. AjusterLes valeurs internes changent légèrement et l’exercice recommence.La reconnaissance ou la génération s’améliore progressivement.
Cas pratique Une langue ne correspond pas à une seule voix

Une langue ne correspond pas à une seule voix

Situation

Un modèle entraîné sur du français formel avec quelques voix de studio peut rencontrer des difficultés avec les accents régionaux, le mélange de langues, les conversations rapides, le téléphone et le vocabulaire informel.

À retenir

Les données doivent représenter les locuteurs et les conditions réelles, pas seulement le nom de la langue.

Cas pratique Les descriptions musicales influencent le contrôle

Les descriptions musicales influencent le contrôle

Situation

Si les morceaux d’entraînement sont mal décrits, le modèle peut confondre instruments, tempo, ambiance et structure même lorsque la qualité audio est bonne.

À retenir

Des descriptions utiles relient les consignes écrites aux caractéristiques audibles.

Les principales familles de modèles audio

Les principales familles de modèles audio

L’IA audio comprend plusieurs tâches qui demandent des modèles différents. Un générateur de voix n’est pas automatiquement un modèle de transcription et un modèle musical n’est pas conçu pour isoler la parole dans un entretien bruyant.

Choisissez la famille selon la transformation recherchée : texte vers voix, voix vers texte, une voix vers une autre, description vers musique ou enregistrement bruité vers parole plus propre.

Tâches audio et entrées
TâcheEntréeSortie
Texte vers voixTexte, langue, voix et consignes d’interprétation.Narration ou dialogue parlé.
Voix vers texteAudio ou vidéo contenant de la parole.Transcription, minutage et parfois locuteurs.
Création de voixUne description de l’âge, du ton, de l’accent, de la texture et de l’usage.Un échantillon de voix synthétique.
Clonage de voixUn enregistrement de référence et généralement sa transcription.Une nouvelle parole ressemblant à la voix de référence.
Génération musicaleGenre, instruments, structure, ambiance, tempo et durée.Une chanson, un instrumental, un jingle ou une musique de fond.
Génération d’effets sonoresUne description d’un événement audible et sa durée.Un effet, une ambiance, une texture ou une boucle.
DoublageAudio ou vidéo d’origine et langue cible.Parole traduite alignée sur le contenu original.
Isolation de voixParole mélangée à du bruit, de la musique ou une ambiance.Parole nettoyée ou voix séparée.
Cas pratique Un workflow complet de podcast

Un workflow complet de podcast

Situation

Un entretien est d’abord isolé, puis transcrit, traduit, doublé et mixé avec une musique. Chaque étape utilise une opération audio différente.

À retenir

Un projet peut combiner plusieurs modèles sans demander à un seul modèle de tout faire.

Cas pratique Un effet sonore n’est pas une musique

Un effet sonore n’est pas une musique

Situation

« Une moto arrivant dans une rue mouillée » décrit un événement audible. « Un instrumental énergique de 20 secondes avec percussions et basse » décrit une musique avec rythme et structure.

À retenir

Utilisez l’opération correspondant à ce qui doit être entendu.

Modèles audio fermés et modèles open weight

Modèles audio fermés et modèles open weight

Les modèles audio fermés sont fournis à travers des applications ou API gérées. Ils proposent souvent des voix prêtes à l’emploi, une faible latence, plusieurs langues, des protections et une mise à l’échelle plus simple.

Les modèles audio open weight peuvent être téléchargés et déployés selon leurs licences. Ils offrent davantage de contrôle sur l’hébergement, l’ajustement, la confidentialité, les jeux de voix et l’adaptation linguistique, mais exigent des ressources de calcul et des protections responsables.

Exemples d’écosystèmes audio
AccèsExemplesUsage fréquent
Modèles fermésImole Premium TTS, Imole Transcribe, MAI Voice 2, MAI Transcribe 1.5, les modèles vocaux OpenAI et ElevenLabs.Narration, transcription, clonage, dialogue, musique, effets, doublage et voix interactive sous forme de services gérés.
Modèles open source ou open weightKokoro, Fish Speech, Whisper et différents modèles communautaires de voix ou musique.Déploiement local, transcription privée, adaptation linguistique, voix personnalisées et recherche.
Cas pratique Adapter la technologie vocale aux voix locales

Adapter la technologie vocale aux voix locales

Situation

Une équipe de recherche possède des enregistrements consentis dans une langue africaine sous-représentée. Elle peut adapter un modèle open weight de transcription ou de voix et l’évaluer avec des locuteurs, accents, microphones et environnements absents du jeu d’entraînement.

À retenir

L’adaptation linguistique exige des droits, des données représentatives, une validation par des locuteurs et un benchmark réel.

Cas pratique Utiliser un service géré pour une narration immédiate

Utiliser un service géré pour une narration immédiate

Situation

Une équipe de formation a besoin aujourd’hui d’une narration française et ne veut pas déployer de GPU ni maintenir une infrastructure vocale.

À retenir

Un modèle fermé hébergé offre le chemin le plus court vers une voix exploitable.