Tous les articles
Tutoriels

Tutoriel référence vers vidéo 2026

Une image de référence n'est pas une valeur d'intensité. Soit vous en donnez une au modèle, soit non, et treize des 37 modèles peuvent l'accepter.

Par Flixly Team27 avril 2026
Tutoriel référence vers vidéo 2026

En bref

Treize des 37 modèles de génération vidéo acceptent une référence de personnage : Seedance 2.0, 2.0 Fast et 2.5, Veo 3.1 et 3.1 Lite, Wan 2.7, 3.0 et 3.0 Prime, Kling 3.0 Motion Control, MiniMax H3, Gemini Omni Flash et les deux modèles Happy Horse. Kling 3.0 lui-même ne l'accepte pas. Il n'existe aucune valeur d'intensité de référence : le résultat dépend donc de l'image de référence, qui doit être de face ou de trois quarts, grande dans le cadre, éclairée uniformément, neutre, nette, et exactement le même fichier à chaque fois.

Une image de référence n'est pas une valeur d'intensité. Soit vous en donnez une au modèle, soit non.

Il n'y a pas de 0.75 à régler, pas de pourcentage d'erreur de points faciaux à viser, pas de paramètre d'encodeur à configurer. Ce qui détermine si un personnage tient tout au long d'un clip, c'est la qualité de l'image que vous fournissez et le modèle auquel vous la fournissez.

Vous maîtrisez entièrement ces deux éléments, ce qui vaut mieux qu'un curseur.

Quels modèles acceptent vraiment une référence

Treize des 37 modèles de génération vidéo. Se tromper sur ce point est la raison la plus fréquente pour laquelle on conclut que la référence vers vidéo « ne fonctionne pas » :

Seedance 2.0, 2.0 Fast et 2.5 · Veo 3.1 et 3.1 Lite · Wan 2.7, 3.0 et 3.0 Prime · Kling 3.0 Motion Control · MiniMax H3 · Gemini Omni Flash · Happy Horse et Happy Horse 1.1

Grand absent : Kling 3.0 lui-même. Il ne fait que du texte en vidéo et de l'image en vidéo. Si vous envoyez un visage à Kling 3.0 et qu'il vous ignore, voilà pourquoi : cette capacité se trouve sur Kling 3.0 Motion Control.

Commencez par la référence vers vidéo.

Tout repose sur l'image de référence

Tout découle de ce fichier : il mérite plus de soin que le prompt.

De face ou de trois quarts. Un profil ne donne au modèle qu'un œil et une demi-mâchoire : il invente le reste, et cette invention change à chaque image.

Grande dans le cadre. Un visage qui n'occupe qu'une petite partie d'un plan large contient peu de détails. Recadrez.

Éclairée uniformément. Les ombres dures sont intégrées comme s'il s'agissait de la structure du visage. Une lumière plate et homogène donne au modèle la forme réelle.

Expression neutre. Un grand sourire sur la référence a tendance à persister dans des plans où il n'a rien à faire.

Nette. Le flou de la référence devient une bouillie en mouvement, et aucun prompt ne le rattrape.

Si vous générez la référence au lieu de la photographier, faites-le délibérément : un portrait propre créé dans ce but vaut mieux qu'une image extraite d'autre chose.

Réutilisez exactement le même fichier pour chaque génération. Pas une image similaire : la même. Deux références similaires produisent deux personnes similaires mais différentes, soit précisément l'échec que vous cherchez à éviter.

Rédiger le prompt autour de la référence

Le modèle voit le visage. Ne le décrivez pas.

Consacrer des mots du prompt à « yeux marron, mâchoire saillante, cheveux foncés » concurrence l'image au lieu de la soutenir, et peut éloigner le résultat de la référence fournie.

Décrivez ce que le personnage fait, où il se trouve et ce que fait la caméra :

« Elle marche lentement le long du mur du port, le regard tourné vers la mer. Lumière couverte. La caméra la suit latéralement. »

Gardez la même formulation pour le décor et l'éclairage d'un plan à l'autre, et ne changez que l'action. C'est ainsi qu'une série de clips forme un tout.

Pourquoi l'identité dérive encore

Trois causes réelles, dont aucune n'est un réglage manquant.

La durée. L'identité tient sur quelques secondes et se dégrade sur une durée plus longue. Si un visage résiste quatre secondes et se délite à dix, générez des clips plus courts et montez-les ensemble.

La qualité de la référence. Voir ci-dessus : c'est de loin la cause la plus fréquente.

Le mauvais modèle. Si le modèle ne prend pas en charge les références, la référence ne sert strictement à rien.

Quand la référence vers vidéo n'est pas le bon outil

Une séquence continue plutôt que des plans séparés. Le Long Video Generator enchaîne des segments : chacun reprend le clip terminé du précédent et continue à partir de sa dernière image, les références étant transmises tout du long. Cela préserve l'environnement autant que le personnage, ce que les références seules ne permettent pas.

Une performance précise. Motion Control transfère le mouvement d'une vidéo pilote sur l'image d'un personnage. Quand vous disposez d'un clip du mouvement voulu, le transférer vaut mieux que le décrire.

Des scènes distinctes dans plusieurs lieux. Le Series Generator est conçu pour cela.

Des points de départ et d'arrivée précis. De la première à la dernière image, uniquement sur Seedance 2.0 et 2.0 Fast.

Ce qui n'existe pas

Aucune intensité de référence. Aucune valeur ne règle le degré de respect de la référence, sur aucun modèle.

Aucune métrique de points faciaux ou de dérive. Aucun chiffre publié sur la dérive faciale par modèle, aucun pourcentage à ne pas dépasser. Les articles qui en citent un l'ont inventé.

Aucun encodeur de référence dédié à configurer, et aucun masque par zone nulle part.

Un modèle expose bien une seed : Wan 2.7, qui accepte aussi un prompt négatif. C'est le seul, ce qui en fait le choix idéal quand la reproductibilité compte plus que tout.

Un workflow qui tient la route

  1. Créez une image de référence solide et enregistrez-la.
  2. Choisissez un modèle parmi les treize.
  3. Décrivez l'action et la caméra, jamais le visage.
  4. Générez court. Jugez l'identité honnêtement à la fin du clip, pas au début.
  5. Réutilisez la référence identique pour chaque plan suivant.

L'étape 1 fait le résultat. Tout le reste n'est que répétition.

Le catalogue se trouve sur Modèles, chaque génération est chiffrée avant son lancement, et les prix des packs figurent sur la page des tarifs.

Questions fréquentes

Quels modèles acceptent une image de référence ?

Treize des 37 : Seedance 2.0, 2.0 Fast et 2.5, Veo 3.1 et 3.1 Lite, Wan 2.7, 3.0 et 3.0 Prime, Kling 3.0 Motion Control, MiniMax H3, Gemini Omni Flash et les deux modèles Happy Horse. Kling 3.0 lui-même ne fait que du texte en vidéo et de l'image en vidéo : lui envoyer un visage ne sert donc à rien.

Quelle intensité de référence dois-je définir ?

Aucun modèle ne propose d'intensité de référence. Soit vous fournissez une référence, soit non. Ce qui détermine le résultat, c'est la qualité de l'image et le modèle qui la reçoit, deux éléments que vous maîtrisez entièrement.

Qu'est-ce qui fait une bonne image de référence ?

De face ou de trois quarts plutôt que de profil, grande dans le cadre, éclairée uniformément sans ombres dures, avec une expression neutre, et nette. Le flou de la référence devient une bouillie en mouvement, et aucun prompt ne le rattrape. Réutilisez exactement le même fichier à chaque fois, car deux références similaires produisent deux personnes similaires mais différentes.

Dois-je aussi décrire le personnage dans le prompt ?

Non. Le modèle voit le visage. Le décrire entre en concurrence avec l'image et peut éloigner le résultat de la référence fournie. Décrivez ce que fait le personnage, où il se trouve et ce que fait la caméra, en gardant la même formulation pour le décor et l'éclairage d'un plan à l'autre.

Pourquoi le visage dérive-t-il encore ?

Trois causes : le clip est trop long, car l'identité tient sur quelques secondes et se dégrade sur une durée plus longue ; l'image de référence est faible ; ou le modèle ne prend pas du tout en charge les références. Aucune ne correspond à un réglage manquant.

Quand utiliser autre chose que la référence vers vidéo ?

Utilisez le Long Video Generator pour une séquence continue, car l'enchaînement préserve l'environnement autant que le personnage. Utilisez Motion Control lorsque vous avez un clip du mouvement à transférer. Utilisez le Series Generator pour des scènes distinctes dans plusieurs lieux, et la génération de la première à la dernière image lorsque vous connaissez les images exactes de début et de fin.

Existe-t-il une métrique de dérive ou de précision des points faciaux ?

Non. Il n'existe aucun chiffre publié sur la dérive faciale par modèle, ni aucun pourcentage à ne pas dépasser. Les articles qui citent des taux d'erreur de points faciaux les ont inventés. Un modèle, Wan 2.7, expose bien une seed ainsi qu'un prompt négatif, ce qui en fait le choix idéal quand la reproductibilité compte avant tout.

Les outils cités dans cet article

tutorielsréférence vers vidéocohérence des personnagesvidéo

Prêt à créer avec Tutoriels ?

Ouvrez le studio IA de Flixly et testez tutoriels avec plus de 50 modèles — gratuit pour commencer.

Tutoriel référence vers vidéo | Flixly