全部文章
教程

参考图生成视频教程 2026

参考图不是一个强度数值。你要么给模型一张,要么不给,而 37 个模型中有十三个可以接受参考图。

作者:Flixly Team2026年4月27日
参考图生成视频教程 2026

一句话总结

37 个视频生成模型中有十三个支持角色参考:Seedance 2.0、2.0 Fast 和 2.5,Veo 3.1 和 3.1 Lite,Wan 2.7、3.0 和 3.0 Prime,Kling 3.0 Motion Control,MiniMax H3,Gemini Omni Flash,以及两款 Happy Horse 模型。Kling 3.0 本身不支持。参考强度这个数值并不存在,所以效果取决于参考图本身:正脸或四分之三侧脸、在画面中占比大、光线均匀、表情中性、清晰锐利,并且每次都使用完全相同的文件。

参考图不是一个强度数值。你要么给模型一张,要么不给。

没有 0.75 这样的数值可调,没有面部关键点误差百分比可追,也没有编码器设置可配。角色能否在整个片段中保持一致,取决于你交出的图片质量,以及你把它交给了哪个模型。

这两点完全由你掌控,这比一个调节旋钮要好得多。

哪些模型真正支持参考图

37 个视频生成模型中的十三个。搞错这一点,是人们认为参考图生成视频“不管用”的最常见原因:

Seedance 2.0、2.0 Fast 和 2.5 · Veo 3.1 和 3.1 Lite · Wan 2.7、3.0 和 3.0 Prime · Kling 3.0 Motion Control · MiniMax H3 · Gemini Omni Flash · Happy Horse 和 Happy Horse 1.1

值得注意的是,Kling 3.0 本身不在其中。它只支持文生视频和图生视频。如果你一直在给 Kling 3.0 上传人脸,却发现它毫无反应,原因就在这里——这项能力在 Kling 3.0 Motion Control 上。

参考图生成视频开始。

参考图就是全部工作

一切都继承自这个文件,所以它比提示词更值得用心。

正脸或四分之三侧脸。 纯侧脸只给模型一只眼睛和半边下颌作为依据,其余部分全靠模型编造,而编造的内容每一帧都在变。

在画面中占比大。 在广角镜头里只占一小块的脸,携带的细节很少。请裁切放大。

光线均匀。 硬阴影会被当作面部结构固化下来。平整、均匀的光线才能让模型看到真实的轮廓。

表情中性。 参考图里的大笑容往往会延续到不该出现的镜头里。

清晰锐利。 参考图中的模糊在运动中会变成一团糊,任何提示词都救不回来。

如果参考图是生成的而不是拍摄的,那就有针对性地生成:专门为此制作的干净肖像,胜过从别处截取的一帧。

每次生成都复用完全相同的文件。不是相似的图片,而是同一张。两张相似的参考图会生成两个相似却不同的人,这恰恰是你想避免的问题。

围绕参考图编写提示词

模型能看到这张脸。不要描述它。

把提示词花在“棕色眼睛、轮廓分明的下颌、深色头发”上,不但不能辅助图片,反而会与之竞争,还可能把结果拉离你提供的参考。

要写角色在做什么、身处何处,以及镜头如何运动:

“她沿着港口的防波堤慢慢走着,望向大海。阴天光线。镜头在一旁跟拍。”

在各个镜头之间保持场景和光线的描述一致,只改变动作。这样一组片段看起来才是一个整体。

为什么身份仍会漂移

有三个真实原因,没有一个是缺了某个设置。

时长。 身份在几秒内能保持,时间一长就会退化。如果一张脸撑过了四秒、到第十秒就散了,那就生成更短的片段,再剪辑到一起。

参考图质量。 上文已经讲过,这是迄今为止最常见的原因。

选错模型。 如果模型不支持参考,参考图就完全不起作用。

什么时候参考图生成视频不是合适的工具

连续的片段,而不是分开的镜头。Long Video Generator 会把各段串联起来,每一段都带上前一段已完成的片段,并从其最后一帧继续,参考图全程随行。这样既能保持角色,也能保持环境,而单靠参考图做不到这一点。

特定的表演。 Motion Control 会把驱动视频中的动作迁移到角色图片上。当你手里有想要的动作片段时,迁移比描述更有效。

跨多个地点的独立场景。 Series Generator 正是为此设计的。

精确的起点和终点。 使用首尾帧生成,仅支持 Seedance 2.0 和 2.0 Fast。

哪些说法并不存在

没有参考强度。 任何模型上都没有用来调节参考图遵循程度的数值。

没有关键点或漂移指标。 没有按模型公布的面部漂移数据,也没有需要控制在其以下的百分比。引用这类数字的文章都是编造的。

没有可配置的专用参考编码器,任何地方也没有分区域蒙版。

确实有一个模型提供 seed:Wan 2.7,它还支持负面提示词。它是唯一一个,因此当可复现性比什么都重要时,它就是首选。

一套靠得住的工作流程

  1. 制作一张高质量的参考图并保存。
  2. 从这十三个模型中选一个。
  3. 写动作和镜头,永远不要写脸。
  4. 生成短片段。在片段结尾而不是开头,诚实地评估身份是否保持。
  5. 后续每个镜头都复用完全相同的参考图。

第 1 步决定结果。之后的一切都只是重复。

模型目录见模型,每次生成在运行前都会显示报价,套餐价格见定价页面

常见问题

哪些模型支持参考图?

37 个中的十三个:Seedance 2.0、2.0 Fast 和 2.5,Veo 3.1 和 3.1 Lite,Wan 2.7、3.0 和 3.0 Prime,Kling 3.0 Motion Control,MiniMax H3,Gemini Omni Flash,以及两款 Happy Horse 模型。Kling 3.0 本身只支持文生视频和图生视频,所以给它上传人脸没有任何作用。

参考强度应该设为多少?

所有模型都没有参考强度设置。你要么提供参考图,要么不提供。决定结果的是图片质量和接收它的模型,而这两点完全由你掌控。

什么样的参考图才算好?

正脸或四分之三侧脸,而不是纯侧脸;在画面中占比大;光线均匀、没有硬阴影;表情中性;清晰锐利。参考图中的模糊在运动中会变成一团糊,任何提示词都救不回来。每次都复用完全相同的文件,因为两张相似的参考图会生成两个相似却不同的人。

还需要在提示词里描述角色吗?

不用。模型能看到这张脸。再去描述它会与图片相互竞争,可能把结果拉离你提供的参考。应该写角色在做什么、身处何处、镜头如何运动,并在各个镜头之间保持场景和光线的描述一致。

为什么脸还是会漂移?

三个原因:片段太长,身份在几秒内能保持,时间一长就会退化;参考图质量差;或者模型根本不支持参考。这些都不是缺了哪个设置。

什么时候应该用参考图生成视频以外的工具?

需要连续片段时用 Long Video Generator,因为链式生成既能保持角色,也能保持环境。有想要迁移的动作片段时用 Motion Control。跨多个地点的独立场景用 Series Generator;如果确切知道起始和结束画面,就用首尾帧生成。

有没有漂移或关键点精度指标?

没有。并不存在按模型公布的面部漂移数据,也没有需要控制在其以下的百分比。那些引用面部关键点误差率的文章都是编造的。有一个模型 Wan 2.7 确实提供 seed 和负面提示词,因此当可复现性最重要时,它是首选。

本文提到的工具

教程参考图生成视频角色一致性视频

准备好用教程创作了吗?

直接进入 Flixly 的 AI 工作室,用 50+ 个模型试试教程——免费上手。