Guides Imọlẹ Parcours24 / 88
Apprendre l’IA · Leçon 12/17

Comment générer de la voix, de la musique et des sons ?

Préparez un texte, dirigez une voix, choisissez le bon modèle Imọlẹ et générez narration, musique ou effets sonores.

Introduction à l’IA Durée indicative · 45 minutes

Objectifs de la leçon

Préparer un texte facile à prononcer correctement.

Décrire séparément l’identité et l’interprétation d’une voix.

Choisir parmi les modèles de voix, création de voix, musique et effets d’Imọlẹ.

Choisir un format audio pour l’édition, la diffusion ou l’archivage.

Écrire pour l’oreille, pas seulement pour la page

Écrire pour l’oreille, pas seulement pour la page

Une phrase agréable à lire peut sonner artificielle. Les longues propositions, abréviations non expliquées, séries de nombres, URL et ponctuations ambiguës peuvent provoquer de mauvaises pauses ou prononciations.

Découpez le texte en unités courtes adaptées à la parole. Écrivez dates, prix, numéros et abréviations sous la forme que vous souhaitez entendre. Ajoutez de la ponctuation aux endroits où la voix doit respirer, ralentir ou insister.

Les noms, lieux et mots en fon, adja, ewe, yoruba ou dans une autre langue doivent être testés avant de générer un long fichier. Lorsque le modèle le permet, utilisez une indication de prononciation ou une écriture phonétique ; sinon, reformulez le contexte immédiat pour aider le modèle.

Cas pratique Texte écrit pour la lecture

Texte écrit pour la lecture

Situation

« L’événement commence le 08/09 à 09:00 et l’inscription coûte 7500 FCFA. » La date est ambiguë et le nombre peut être lu de manière artificielle.

À retenir

Le modèle a besoin de la forme parlée, pas seulement d’une notation écrite compacte.

Cas pratique Texte préparé pour la voix

Texte préparé pour la voix

Situation

« L’événement commence le huit septembre, à neuf heures. L’inscription coûte sept mille cinq cents francs CFA. »

À retenir

Une formulation explicite réduit l’ambiguïté et améliore le rythme.

Décrire la voix et son interprétation

Décrire la voix et son interprétation

L’identité vocale décrit la personne que la voix évoque : adulte ou jeune, féminine ou masculine, légère ou grave, douce ou texturée, accent, langue et caractère général.

L’interprétation décrit la manière de dire le texte : chaleureuse, rassurante, autoritaire, énergique, intime, sérieuse, souriante, lente, conversationnelle ou dramatique. Une même voix peut interpréter la même phrase de plusieurs façons.

Évitez les consignes contradictoires comme « très rapide, calme, avec de longues pauses ». Donnez une priorité et précisez l’usage : publicité radio, formation, assistant téléphonique, documentaire, dialogue de personnage ou lecture accessible.

Contrôles vocaux utiles
ContrôleSignificationExemple
Langue et accentLa prononciation linguistique et la couleur régionale.Français avec un accent béninois naturel.
RythmeLa vitesse de la parole.Assez lent pour une formation.
HauteurLe caractère aigu ou grave de la voix.Légèrement plus grave sans devenir théâtral.
ÉmotionLe sentiment transmis par l’interprétation.Chaleureuse et optimiste, sans enthousiasme excessif.
InsistanceLes mots qui doivent attirer l’attention.Insister sur la date et la gratuité de l’inscription.
PauseUn moment de silence entre deux idées.Courte pause après le nom du programme.
Cas pratique Narration de formation

Narration de formation

Situation

Voix féminine adulte, français clair, interprétation calme et patiente, rythme modéré, courtes pauses entre les étapes et prononciation précise des termes agricoles.

À retenir

La direction vocale correspond à un objectif pédagogique.

Cas pratique Publicité radio

Publicité radio

Situation

Voix de jeune adulte, amicale et énergique, rythme conversationnel rapide, ton souriant et forte insistance sur l’offre et le numéro de téléphone.

À retenir

Le même texte demanderait une autre interprétation pour un documentaire.

Choisir un modèle audio dans Imọlẹ

Choisir un modèle audio dans Imọlẹ

Le Playground Audio regroupe les modèles selon l’opération. Choisissez d’abord Voix, Clonage, Création de voix, Transcription, Musique, Effets sonores, Doublage ou Isolation. La liste affiche ensuite uniquement les modèles compatibles.

Ne choisissez pas uniquement selon la marque. Comparez langues, naturel, émotions, vitesse, latence, clonage, format de sortie, prix et destination réelle du fichier.

Choix fréquents dans le Playground Audio
Modèle ou outilÀ utiliser pourMéthode de prompt
Imole Quick VoiceVoix multilingue rapide avec contrôles simples.Choisir langue et voix, puis régler vitesse, hauteur et volume.
Imole Standard TTSNarration standard, voix locales et clonage pris en charge.Utiliser un texte propre, la langue, la vitesse et une référence autorisée pour le clonage.
Imole Premium TTSNarration naturelle haut de gamme et voix guidée par référence.Fournir un texte finalisé et une direction d’interprétation claire.
MAI Voice 2Narration multilingue expressive et plusieurs locuteurs lorsque disponible.Indiquer langue, locuteur, usage, ton et rythme.
GPT 4o Mini TTSVoix d’application et narration guidées par instructions.Écrire le texte et expliquer comment il doit être dit.
Eleven v3Voix multilingue très expressive et dialogues de personnages.Utiliser une direction d’interprétation claire et peu de balises audio.
Eleven Flash ou TurboVoix interactive à faible latence ou équilibre vitesse-qualité.Garder des instructions courtes et tester la prononciation à vitesse réelle.
Voice DesignCréer une nouvelle voix synthétique depuis une description.Décrire âge, texture, accent, hauteur, émotions et usage.
Musique et effets sonoresGénérer morceaux, jingles, ambiances et sons individuels.Décrire uniquement les caractéristiques audibles et les adapter à une durée.
Cas pratique Assistant téléphonique rapide

Assistant téléphonique rapide

Situation

Un client entend de courtes réponses pendant un appel d’assistance Mobile Money. La faible latence et la prononciation claire comptent davantage qu’une émotion théâtrale.

À retenir

Choisissez un modèle rapide et testez-le à la vitesse réelle de l’interaction.

Cas pratique Voix de documentaire

Voix de documentaire

Situation

Un film de cinq minutes sur des entrepreneures exige chaleur, respiration naturelle, ton stable et prononciation soignée des noms.

À retenir

Un modèle haut de gamme ou expressif peut justifier davantage de temps de génération.

Prompter la musique et les effets sonores

Prompter la musique et les effets sonores

Un prompt musical doit décrire l’usage, le genre, les instruments, le tempo, l’ambiance, la structure, les voix, la durée et la fin. « Musique africaine » est trop vague. Nommez les instruments audibles, le rythme, l’énergie et le style de production importants.

Un prompt d’effet sonore décrit une source, une action, un espace, une distance, une intensité, une durée et les sons indésirables. Ne décrivez pas les couleurs ou angles de caméra s’ils ne correspondent à aucun événement audible.

Pour une musique placée sous une voix, demandez un arrangement contenu qui laisse de l’espace dans les fréquences moyennes. Un morceau dense peut concurrencer la narration même si les deux fichiers sont réussis séparément.

Cas pratique Musique de fond pour une formation

Musique de fond pour une formation

Situation

Instrumental optimiste de 30 secondes, percussions légères, motif doux de marimba, basse chaleureuse, production moderne et propre, tempo modéré, aucune voix, faible densité sous la narration et fin nette.

À retenir

Le prompt explique l’identité musicale et son rôle sous la narration.

Cas pratique Ambiance de marché

Ambiance de marché

Situation

Ambiance matinale d’un marché ouvert, pas proches et manipulation de tissus, conversations lointaines, sonnette de vélo occasionnelle, léger mouvement de rue, perspective naturelle, huit secondes, aucune musique dominante et aucun cri.

À retenir

Les événements audibles, la distance, la densité et les exclusions rendent l’ambiance contrôlable.

MP3, WAV, FLAC, AAC, Opus et PCM

MP3, WAV, FLAC, AAC, Opus et PCM

Choisissez le format selon l’étape suivante. Un fichier maître destiné au montage demande plus de détails qu’une note vocale envoyée par messagerie. Tous les modèles ne prennent pas en charge tous les formats.

Les formats avec perte comme MP3, AAC et Opus réduisent le poids en supprimant des informations. Les formats sans perte ou non compressés comme FLAC, WAV et PCM conservent davantage de détails et conviennent mieux au montage, à l’archivage et aux traitements répétés.

Choisir un format de sortie audio
FormatUsage conseilléCompromis
MP3Partage, podcasts, sites et lecture universelle.Léger et compatible, mais avec compression destructive.
WAVMontage, mixage, fichiers maîtres et livraison professionnelle.Haute qualité et montage simple, mais fichiers souvent lourds.
FLACArchivage sans perte et diffusion de qualité.Plus léger que WAV non compressé, mais moins universel.
AACMobile, streaming et diffusion vidéo.Compression avec perte efficace et largement compatible.
OpusAppels, applications temps réel et audio web.Excellent à faible débit, mais non pris en charge par tous les éditeurs.
PCMTraitement brut, ingénierie et pipelines non compressés.Simplicité et détail maximaux, fichiers très lourds.
Cas pratique Conserver un fichier maître WAV

Conserver un fichier maître WAV

Situation

Une narration sera nettoyée, découpée, mixée et exportée plusieurs fois. L’équipe conserve un WAV pour le montage et crée une copie MP3 pour la diffusion.

À retenir

Séparez le format maître du format de diffusion.

Cas pratique Voix interactive

Voix interactive

Situation

Un assistant web doit répondre rapidement sur des connexions mobiles limitées. Opus ou un autre format efficace peut être plus utile qu’un WAV lourd.

À retenir

La destination détermine l’équilibre utile entre qualité et poids.