Guides Imọlẹ Parcours26 / 88
Apprendre l’IA · Leçon 14/17

Qu’est-ce qu’un modèle de génération vidéo ?

Découvrez comment un modèle crée du mouvement, conserve une scène dans le temps et transforme texte, image ou vidéo en séquence animée.

Introduction à l’IA Durée indicative · 40 minutes

Objectifs de la leçon

Expliquer pourquoi la vidéo est plus difficile à générer qu’une image fixe.

Comprendre images vidéo, mouvement et cohérence temporelle.

Distinguer les principaux workflows vidéo.

Comparer modèles vidéo fermés et open weight.

Une vidéo est une suite d’images qui évoluent dans le temps

Une vidéo est une suite d’images qui évoluent dans le temps

Une vidéo est composée d’images fixes affichées rapidement. Le modèle doit créer non seulement une bonne image, mais de nombreuses images liées tout en conservant sujet, objets, géométrie, lumière, style et direction du mouvement.

La cohérence temporelle signifie que les informations restent crédibles d’une image à la suivante. Une personne doit conserver visage et vêtements, une tasse ne doit pas disparaître, une main doit suivre une trajectoire continue et les ombres doivent réagir au mouvement.

Une vidéo générée peut contenir mouvement du sujet, mouvement de caméra, dialogue, ambiance, musique et effets. Les modèles avec audio natif produisent le son avec l’image ; d’autres workflows ajoutent l’audio ensuite.

Image vidéo Image vidéo

Une image fixe à l’intérieur de la séquence.

À 25 images par seconde, une seconde contient 25 images.
Mouvement Mouvement

Changement de position, forme, lumière ou caméra dans le temps.

Une vendeuse soulève un panier pendant que la caméra avance.
Cohérence temporelle Cohérence temporelle

La cohérence entre les images successives.

Le panier conserve la même taille, le même motif et la même anse.
Plan Plan

Une séquence continue sans coupe.

Un gros plan de six secondes sur des mains emballant du café.
Cas pratique Plan simple et contrôlable

Plan simple et contrôlable

Situation

Des mains versent des fèves de cacao dans un panier tressé, caméra fixe, lumière naturelle, cinq secondes.

À retenir

Une action et un comportement caméra sont plus faciles à conserver.

Cas pratique Plan surchargé

Plan surchargé

Situation

Une personne entre dans une boutique, parle, change de vêtements, monte sur une moto, traverse la ville et arrive dans une ferme en huit secondes.

À retenir

Trop d’événements provoquent des transitions impossibles et des changements d’identité.

Comment un modèle vidéo apprend le mouvement

Comment un modèle vidéo apprend le mouvement

L’entraînement utilise vidéos, images, descriptions, audio, informations de caméra et parfois des images fixes. Le modèle apprend quelles transformations visuelles se suivent et comment les descriptions correspondent aux sujets, actions, mouvements de caméra et sons.

De nombreux modèles commencent avec des représentations bruitées et reconstruisent progressivement une séquence cohérente. Ils doivent estimer l’apparence et le temps : aspect du sujet, déplacement, éléments cachés et contenu révélé lorsque la caméra change de point de vue.

Les données vidéo sont coûteuses et complexes. Des descriptions faibles, clips répétitifs, cultures peu représentées, mouvements irréalistes ou mauvais alignements audio peuvent devenir des limites du modèle.

Ce que le modèle doit apprendre en même temps
DimensionQuestionÉchec possible
ApparenceÀ quoi ressemble chaque sujet ?Le visage, les vêtements ou le produit changent.
MouvementComment chaque objet se déplace-t-il ?Pieds qui glissent, mains déformées ou accélération impossible.
MasquageQue se passe-t-il lorsqu’un objet passe derrière un autre ?Les objets disparaissent ou réapparaissent différemment.
CaméraComment le point de vue change-t-il ?Zoom, rotation ou perspective inattendus.
AudioQuel son correspond à quel moment ?Impact en retard, mauvaise voix ou ambiance incohérente.
Cas pratique Le côté caché doit être inventé

Le côté caché doit être inventé

Situation

Un produit est visible uniquement de face, mais la caméra tourne autour. Le modèle doit inventer l’arrière et peut modifier logo, poignée ou forme.

À retenir

Des références sous plusieurs angles réduisent l’incertitude lors d’un mouvement de caméra.

Cas pratique Le son et l’image ne correspondent pas

Le son et l’image ne correspondent pas

Situation

Un marteau touche la table, mais le son d’impact arrive avant le contact. Chaque élément paraît plausible seul, mais le décalage détruit le réalisme.

À retenir

La cohérence audiovisuelle est une dimension supplémentaire de la qualité vidéo.

Les principaux workflows vidéo

Les principaux workflows vidéo

Le workflow dépend des sources. Le texte vers vidéo offre le plus de liberté. L’image vers vidéo part d’un visuel approuvé et apporte davantage de continuité. La génération avec première et dernière images définit le début et l’arrivée du plan.

La vidéo vers vidéo transforme un clip existant. L’animation de perspective crée profondeur et mouvement depuis une image. Le montage déterministe utilise des outils classiques pour coupes, sous-titres, transitions, logos et minutage exacts.

Choisir le workflow selon la source
WorkflowEntréeUsage
Texte vers vidéoUne description audiovisuelle.Créer un plan lorsqu’aucun visuel approuvé n’existe.
Image vers vidéoUne image source et une direction de mouvement.Animer produit, portrait, affiche ou scène.
Première et dernière imagesUne image de départ et une image d’arrivée.Guider une transition ou un changement d’état prévu.
Vidéo vers vidéoUn clip existant et une instruction de transformation.Restyliser, rééclairer, remplacer ou réinterpréter le mouvement.
Animation de perspectiveUne image avec une profondeur visible.Créer parallaxe, orbite, zoom ou travelling.
Montage classiqueClips générés et filmés.Découper, ordonner, sous-titrer, mixer et exporter précisément.
Cas pratique L’identité du produit compte

L’identité du produit compte

Situation

Un véritable paquet de café doit rester reconnaissable. L’image approuvée devient la première image et le prompt demande seulement une rotation lente et un travelling avant.

À retenir

L’image vers vidéo est plus sûre que de recréer l’emballage depuis le texte.

Cas pratique Sous-titres exacts

Sous-titres exacts

Situation

Un clip généré demande des sous-titres français et anglais vérifiés. La vidéo propre est générée, puis les sous-titres sont ajoutés au montage.

À retenir

Utilisez des outils déterministes pour le texte et le minutage exacts.

Modèles vidéo fermés et modèles open weight

Modèles vidéo fermés et modèles open weight

Les modèles vidéo fermés fonctionnent comme des services gérés. Ils offrent souvent une qualité soignée, une grande infrastructure, des références avancées, de l’audio natif et des outils créatifs intégrés.

Les modèles open weight peuvent être téléchargés et adaptés selon leurs licences. Ils offrent contrôle local, workflows privés, recherche, ajustement personnalisé et outils communautaires, mais les besoins en matériel et stockage peuvent être importants.

Exemples d’écosystèmes vidéo
AccèsExemplesPoints forts fréquents
Modèles fermésVeo 3.1 de Google, Seedance 2.0 de ByteDance, Runway Gen-4.5 et Kling Video.Génération gérée, références complexes, qualité cinématographique, édition et audio natif selon le modèle.
Modèles open source ou open weightHunyuanVideo, Wan et adaptations communautaires.Génération locale, recherche, pipelines personnalisés, ajustement et déploiement privé.
Cas pratique Utiliser des poids ouverts pour des scènes culturelles locales

Utiliser des poids ouverts pour des scènes culturelles locales

Situation

Un studio possède des vidéos et références autorisées du Bénin et veut adapter un modèle à des architectures, vêtements, mouvements et environnements que les modèles généralistes reproduisent mal.

À retenir

L’adaptation exige données autorisées, validation culturelle, tests négatifs et contrôle de la mémorisation des clips sources.

Cas pratique Utiliser un modèle géré pour un plan exigeant

Utiliser un modèle géré pour un plan exigeant

Situation

Une agence a besoin d’une publicité cinématographique complexe avec plusieurs références et dialogue natif, mais ne possède aucune infrastructure de modèle vidéo.

À retenir

Un service fermé peut offrir le chemin de production le plus court.