参考图生成视频教程 2026
参考图不是一个强度数值。你要么给模型一张,要么不给,而 37 个模型中有十三个可以接受参考图。
一句话总结
37 个视频生成模型中有十三个支持角色参考:Seedance 2.0、2.0 Fast 和 2.5,Veo 3.1 和 3.1 Lite,Wan 2.7、3.0 和 3.0 Prime,Kling 3.0 Motion Control,MiniMax H3,Gemini Omni Flash,以及两款 Happy Horse 模型。Kling 3.0 本身不支持。参考强度这个数值并不存在,所以效果取决于参考图本身:正脸或四分之三侧脸、在画面中占比大、光线均匀、表情中性、清晰锐利,并且每次都使用完全相同的文件。
参考图不是一个强度数值。你要么给模型一张,要么不给。
没有 0.75 这样的数值可调,没有面部关键点误差百分比可追,也没有编码器设置可配。角色能否在整个片段中保持一致,取决于你交出的图片质量,以及你把它交给了哪个模型。
这两点完全由你掌控,这比一个调节旋钮要好得多。
哪些模型真正支持参考图
37 个视频生成模型中的十三个。搞错这一点,是人们认为参考图生成视频“不管用”的最常见原因:
Seedance 2.0、2.0 Fast 和 2.5 · Veo 3.1 和 3.1 Lite · Wan 2.7、3.0 和 3.0 Prime · Kling 3.0 Motion Control · MiniMax H3 · Gemini Omni Flash · Happy Horse 和 Happy Horse 1.1
值得注意的是,Kling 3.0 本身不在其中。它只支持文生视频和图生视频。如果你一直在给 Kling 3.0 上传人脸,却发现它毫无反应,原因就在这里——这项能力在 Kling 3.0 Motion Control 上。
从参考图生成视频开始。
参考图就是全部工作
一切都继承自这个文件,所以它比提示词更值得用心。
正脸或四分之三侧脸。 纯侧脸只给模型一只眼睛和半边下颌作为依据,其余部分全靠模型编造,而编造的内容每一帧都在变。
在画面中占比大。 在广角镜头里只占一小块的脸,携带的细节很少。请裁切放大。
光线均匀。 硬阴影会被当作面部结构固化下来。平整、均匀的光线才能让模型看到真实的轮廓。
表情中性。 参考图里的大笑容往往会延续到不该出现的镜头里。
清晰锐利。 参考图中的模糊在运动中会变成一团糊,任何提示词都救不回来。
如果参考图是生成的而不是拍摄的,那就有针对性地生成:专门为此制作的干净肖像,胜过从别处截取的一帧。
每次生成都复用完全相同的文件。不是相似的图片,而是同一张。两张相似的参考图会生成两个相似却不同的人,这恰恰是你想避免的问题。
围绕参考图编写提示词
模型能看到这张脸。不要描述它。
把提示词花在“棕色眼睛、轮廓分明的下颌、深色头发”上,不但不能辅助图片,反而会与之竞争,还可能把结果拉离你提供的参考。
要写角色在做什么、身处何处,以及镜头如何运动:
“她沿着港口的防波堤慢慢走着,望向大海。阴天光线。镜头在一旁跟拍。”
在各个镜头之间保持场景和光线的描述一致,只改变动作。这样一组片段看起来才是一个整体。
为什么身份仍会漂移
有三个真实原因,没有一个是缺了某个设置。
时长。 身份在几秒内能保持,时间一长就会退化。如果一张脸撑过了四秒、到第十秒就散了,那就生成更短的片段,再剪辑到一起。
参考图质量。 上文已经讲过,这是迄今为止最常见的原因。
选错模型。 如果模型不支持参考,参考图就完全不起作用。
什么时候参考图生成视频不是合适的工具
连续的片段,而不是分开的镜头。Long Video Generator 会把各段串联起来,每一段都带上前一段已完成的片段,并从其最后一帧继续,参考图全程随行。这样既能保持角色,也能保持环境,而单靠参考图做不到这一点。
特定的表演。 Motion Control 会把驱动视频中的动作迁移到角色图片上。当你手里有想要的动作片段时,迁移比描述更有效。
跨多个地点的独立场景。 Series Generator 正是为此设计的。
精确的起点和终点。 使用首尾帧生成,仅支持 Seedance 2.0 和 2.0 Fast。
哪些说法并不存在
没有参考强度。 任何模型上都没有用来调节参考图遵循程度的数值。
没有关键点或漂移指标。 没有按模型公布的面部漂移数据,也没有需要控制在其以下的百分比。引用这类数字的文章都是编造的。
没有可配置的专用参考编码器,任何地方也没有分区域蒙版。
确实有一个模型提供 seed:Wan 2.7,它还支持负面提示词。它是唯一一个,因此当可复现性比什么都重要时,它就是首选。
一套靠得住的工作流程
- 制作一张高质量的参考图并保存。
- 从这十三个模型中选一个。
- 写动作和镜头,永远不要写脸。
- 生成短片段。在片段结尾而不是开头,诚实地评估身份是否保持。
- 后续每个镜头都复用完全相同的参考图。
第 1 步决定结果。之后的一切都只是重复。
常见问题
哪些模型支持参考图?▾
37 个中的十三个:Seedance 2.0、2.0 Fast 和 2.5,Veo 3.1 和 3.1 Lite,Wan 2.7、3.0 和 3.0 Prime,Kling 3.0 Motion Control,MiniMax H3,Gemini Omni Flash,以及两款 Happy Horse 模型。Kling 3.0 本身只支持文生视频和图生视频,所以给它上传人脸没有任何作用。
参考强度应该设为多少?▾
所有模型都没有参考强度设置。你要么提供参考图,要么不提供。决定结果的是图片质量和接收它的模型,而这两点完全由你掌控。
什么样的参考图才算好?▾
正脸或四分之三侧脸,而不是纯侧脸;在画面中占比大;光线均匀、没有硬阴影;表情中性;清晰锐利。参考图中的模糊在运动中会变成一团糊,任何提示词都救不回来。每次都复用完全相同的文件,因为两张相似的参考图会生成两个相似却不同的人。
还需要在提示词里描述角色吗?▾
不用。模型能看到这张脸。再去描述它会与图片相互竞争,可能把结果拉离你提供的参考。应该写角色在做什么、身处何处、镜头如何运动,并在各个镜头之间保持场景和光线的描述一致。
为什么脸还是会漂移?▾
三个原因:片段太长,身份在几秒内能保持,时间一长就会退化;参考图质量差;或者模型根本不支持参考。这些都不是缺了哪个设置。
什么时候应该用参考图生成视频以外的工具?▾
需要连续片段时用 Long Video Generator,因为链式生成既能保持角色,也能保持环境。有想要迁移的动作片段时用 Motion Control。跨多个地点的独立场景用 Series Generator;如果确切知道起始和结束画面,就用首尾帧生成。
有没有漂移或关键点精度指标?▾
没有。并不存在按模型公布的面部漂移数据,也没有需要控制在其以下的百分比。那些引用面部关键点误差率的文章都是编造的。有一个模型 Wan 2.7 确实提供 seed 和负面提示词,因此当可复现性最重要时,它是首选。
