Todas las publicaciones
Tutoriales

Tutorial de referencia a video 2026

Una imagen de referencia no es un valor de intensidad. O se la das al modelo o no, y trece de los 37 modelos pueden aceptarla.

Por Flixly Team27 de abril de 2026
Tutorial de referencia a video 2026

En resumen

Trece de los 37 modelos de generación de video aceptan una referencia de personaje: Seedance 2.0, 2.0 Fast y 2.5, Veo 3.1 y 3.1 Lite, Wan 2.7, 3.0 y 3.0 Prime, Kling 3.0 Motion Control, MiniMax H3, Gemini Omni Flash y los dos modelos Happy Horse. Kling 3.0 en sí no la acepta. No existe un valor de intensidad de referencia, así que el resultado depende de la imagen de referencia: frontal o de tres cuartos, grande en el encuadre, con iluminación uniforme, expresión neutra, nítida y exactamente el mismo archivo cada vez.

Una imagen de referencia no es un valor de intensidad. O se la das al modelo o no.

No hay un 0.75 que ajustar, ni un porcentaje de error de puntos faciales que perseguir, ni un ajuste de codificador que configurar. Lo que decide si un personaje se mantiene a lo largo de un clip es la calidad de la imagen que entregas y el modelo al que se la entregas.

Ambas cosas las controlas por completo, lo cual es mejor de lo que habría sido un dial.

Qué modelos aceptan realmente una referencia

Trece de los 37 modelos de generación de video. Equivocarse aquí es la razón más común por la que la gente concluye que la referencia a video "no funciona":

Seedance 2.0, 2.0 Fast y 2.5 · Veo 3.1 y 3.1 Lite · Wan 2.7, 3.0 y 3.0 Prime · Kling 3.0 Motion Control · MiniMax H3 · Gemini Omni Flash · Happy Horse y Happy Horse 1.1

Ausencia notable: Kling 3.0 en sí. Solo hace texto a video e imagen a video. Si has estado subiendo un rostro a Kling 3.0 y viendo cómo te ignora, esa es la razón: la función está en Kling 3.0 Motion Control.

Empieza en referencia a video.

La imagen de referencia lo es todo

Todo hereda de este archivo, así que merece más cuidado que el prompt.

Frontal o de tres cuartos. Un perfil le da al modelo un ojo y media mandíbula con los que trabajar, así que inventa el resto y esa invención cambia en cada fotograma.

Grande en el encuadre. Un rostro que ocupa una parte pequeña de un plano abierto aporta poco detalle. Recorta.

Iluminación uniforme. Las sombras duras se integran como si fueran estructura facial. Una luz plana y uniforme le da al modelo la forma real.

Expresión neutra. Una gran sonrisa en la referencia tiende a persistir en tomas donde no corresponde.

Nítida. La falta de nitidez en la referencia se convierte en un borrón en movimiento, y ningún prompt lo recupera.

Si vas a generar la referencia en lugar de fotografiarla, hazlo a propósito: un retrato limpio creado para este fin supera a un fotograma sacado de otra cosa.

Reutiliza exactamente el mismo archivo en cada generación. No una imagen parecida, la misma. Dos referencias parecidas producen dos personas parecidas pero distintas, que es justo el fallo que intentas evitar.

Cómo escribir el prompt en torno a la referencia

El modelo puede ver el rostro. No lo describas.

Gastar palabras del prompt en "ojos marrones, mandíbula marcada, cabello oscuro" compite con la imagen en lugar de apoyarla, y puede alejar el resultado de la referencia que proporcionaste.

Escribe sobre lo que el personaje hace, dónde está y qué hace la cámara:

"Camina despacio junto al muro del puerto, mirando al mar. Luz nublada. La cámara la sigue de lado."

Mantén coherente la descripción del escenario y la iluminación entre tomas, y cambia solo la acción. Así es como un conjunto de clips se percibe como una sola pieza.

Por qué la identidad sigue desviándose

Tres causas reales, y ninguna es un ajuste que falte.

Duración. La identidad se mantiene durante unos pocos segundos y se degrada con muchos. Si un rostro sobrevive cuatro segundos y se disuelve a los diez, genera clips más cortos y únelos en la edición.

Calidad de la referencia. Ya lo vimos arriba, y es con diferencia la causa más común.

Modelo equivocado. Si el modelo no admite referencias, la referencia no hace absolutamente nada.

Cuándo la referencia a video no es la herramienta adecuada

Una secuencia continua en lugar de tomas separadas. El Long Video Generator encadena segmentos para que cada uno lleve el clip terminado del anterior y continúe desde su último fotograma, con las referencias presentes durante todo el proceso. Eso mantiene el entorno además del personaje, algo que las referencias por sí solas no pueden hacer.

Una actuación específica. Motion Control transfiere el movimiento de un video guía a la imagen de un personaje. Cuando tienes un clip del movimiento que quieres, transferirlo es mejor que describirlo.

Escenas separadas en distintas ubicaciones. El Series Generator está pensado para eso.

Puntos de inicio y fin precisos. Primer a último fotograma, solo en Seedance 2.0 y 2.0 Fast.

Lo que no existe

No hay intensidad de referencia. Ningún valor que regule cuánto se respeta la referencia, en ningún modelo.

No hay métrica de puntos faciales ni de desviación. No existe una cifra publicada de desviación facial por modelo ni un porcentaje por debajo del cual mantenerse. Los artículos que citan una se la inventaron.

No hay un codificador de referencia dedicado que puedas configurar, ni máscaras por región en ninguna parte.

Un modelo sí expone una semilla (seed): Wan 2.7, que además acepta un prompt negativo. Es el único, lo que lo convierte en la opción cuando la repetibilidad importa más que cualquier otra cosa.

Un flujo de trabajo que funciona

  1. Crea una imagen de referencia sólida y guárdala.
  2. Elige un modelo entre los trece.
  3. Escribe sobre la acción y la cámara, nunca sobre el rostro.
  4. Genera clips cortos. Evalúa la identidad con honestidad al final del clip, no al principio.
  5. Reutiliza la referencia idéntica en cada toma posterior.

El paso 1 determina el resultado. Todo lo que viene después es repetición.

El catálogo está en Modelos, cada generación se cotiza antes de ejecutarse y los precios de los paquetes están en la página de precios.

Preguntas frecuentes

¿Qué modelos aceptan una imagen de referencia?

Trece de los 37: Seedance 2.0, 2.0 Fast y 2.5, Veo 3.1 y 3.1 Lite, Wan 2.7, 3.0 y 3.0 Prime, Kling 3.0 Motion Control, MiniMax H3, Gemini Omni Flash y los dos modelos Happy Horse. Kling 3.0 en sí solo hace texto a video e imagen a video, así que subirle un rostro no sirve de nada.

¿Qué intensidad de referencia debo configurar?

Ningún modelo tiene intensidad de referencia. O proporcionas una referencia o no. Lo que decide el resultado es la calidad de la imagen y el modelo que la recibe, y ambas cosas las controlas por completo.

¿Qué hace que una imagen de referencia sea buena?

Frontal o de tres cuartos en lugar de perfil, grande en el encuadre, con luz uniforme sin sombras duras, expresión neutra y nítida. La falta de nitidez en la referencia se convierte en un borrón en movimiento y ningún prompt lo recupera. Reutiliza exactamente el mismo archivo cada vez, porque dos referencias parecidas producen dos personas parecidas pero distintas.

¿También debo describir al personaje en el prompt?

No. El modelo puede ver el rostro. Describirlo compite con la imagen y puede alejar el resultado de la referencia que proporcionaste. Escribe sobre lo que hace el personaje, dónde está y qué hace la cámara, manteniendo coherente la descripción del escenario y la iluminación entre tomas.

¿Por qué el rostro sigue desviándose?

Tres causas: el clip es demasiado largo, ya que la identidad se mantiene durante unos pocos segundos y se degrada con muchos; la imagen de referencia es débil; o el modelo no admite referencias en absoluto. Ninguna de ellas es un ajuste que falte.

¿Cuándo debo usar algo distinto de referencia a video?

Usa el Long Video Generator para una secuencia continua, ya que el encadenamiento mantiene el entorno además del personaje. Usa Motion Control cuando tengas un clip del movimiento que quieres transferir. Usa el Series Generator para escenas separadas en distintas ubicaciones, y primer a último fotograma cuando conozcas las imágenes exactas de inicio y fin.

¿Existe una métrica de desviación o de precisión de puntos faciales?

No. No existe una cifra publicada de desviación facial por modelo ni un porcentaje por debajo del cual mantenerse. Los artículos que citan tasas de error de puntos faciales se las inventaron. Un modelo, Wan 2.7, sí expone una semilla (seed) junto con un prompt negativo, lo que lo convierte en la opción cuando la repetibilidad es lo más importante.

Herramientas mencionadas en esta publicación

tutorialesreferencia a videoconsistencia de personajesvideo

¿Listo para crear con Tutoriales?

Entra directamente en el estudio de IA de Flixly y prueba tutoriales con más de 50 modelos: empezar es gratis.