用 AI 打造史诗级视频指南
主角在不同镜头之间换了一张脸。这是机制问题,不是提示词问题。真正能让角色在多个镜头间保持一致的三种方法。
一句话总结
AI 视频中的角色之所以在镜头间走样,是因为每次生成都会根据文字重新想象角色,而文字对人脸的描述必然有损。有三种机制可以解决:参考图(12 个视频模型支持);首尾帧(Seedance 2.0 和 2.0 Fast 支持);以及链式生成,即每个片段都携带上一个片段的成片,并从其最后一帧继续。先锁定角色,因为之后的每个镜头都会继承它。
第一个镜头里,主角的左脸颊上有一道疤;第二个镜头里,疤不见了;到第四个镜头,连夹克都换了一件。
这才是 AI 视频真正的问题,而且它不是提示词的问题。你可以写出世界上最精确的角色描述,下一次生成照样会走样,因为每次生成都从零开始,根据文字重新想象你的角色。
史诗感意味着多个镜头同属一个世界。因此,整门手艺的核心就是连贯性,而连贯性是机制问题,不是措辞问题。
以下是真正能让角色在多个镜头间保持一致的方法。
为什么重复描述行不通
常见的建议是给角色起个名字,并在每条提示词里重复描述其服装。
这有一点帮助,但无法解决问题,因为文字对人脸的描述必然有损。“深色头发、三十五岁左右、穿皮夹克的女性”能对应数百万人,模型每次都会挑一个不同的人。
纯靠文字生成的每个镜头,都是一次全新的猜测。要保持一致,模型需要看到上一次的结果,而不是读到关于它的描述。
真正有效的三种机制
参考图。 给模型一张角色图片,而不是一段描述。共有十三个模型支持参考生视频,包括 Seedance 2.0 和 2.5、Veo 3.1、Wan 2.7、3.0 和 3.0 Prime、Kling 3.0 Motion Control、MiniMax H3 以及 Gemini Omni Flash。参考图随请求一起发送,因此人脸是被展示出来的,而不是被描述出来的。
首尾帧。 Seedance 2.0 和 Seedance 2.0 Fast 这两个模型可以同时接收起始帧和结束帧,并生成两者之间的运动。把第一个镜头的最后一帧交给第二个镜头,剪辑就会连贯衔接,而不是生硬跳切。
链式生成。 三者中最强的一种,也是 Long Video Generator 存在的原因。
链式生成如何运作
第一个片段根据你的角色参考图生成。之后的每个片段都会把上一个片段的成片作为视频参考,并从其最后一帧继续。角色参考图也会随每个片段一起传入。
这样,每个镜头都能看到两样东西:角色是谁,以及片刻之前世界的确切样子。由于第一个镜头之后没有任何内容是从零重新想象的,角色身份和场景环境都能保持连贯。
这就是四段“长得像”的人物片段与一部连贯作品之间的区别。该功能基于 Seedance 2.5 运行,完整教程见如何用 AI 制作长视频。
一套稳得住的工作流程
在生成任何运动之前先锁定角色。 先得到一张你满意的角色图。之后的每个镜头都会继承它,所以一张平庸的参考图会影响整部作品。这一步值得投入真正的时间。
确定你需要的是独立镜头还是连续序列。 在不同地点之间切换的独立场景适合用 Series Generator。一段连续不断的动作适合用 Long Video Generator 及其链式生成。选错就得重新渲染,所以要慎重选择。
先测试一个片段,再决定做八个。 生成第一个片段,仔细检查它的最后一帧,只有没问题时才继续——因为在链式生成中,之后的每个片段都会继承这一帧。第一个片段的瑕疵,会出现在所有片段里。
把镜头运动和拍摄主体分开控制。 Kling 3.0 Motion Control 和运动控制正是为此而生。在主体提示词里描述镜头运动,往往两头都得不到。
最后再加对白。 先生成画面,再交给对口型。反过来做的话,任何一次重新生成都会让对口型的工作白费。
关于积分成本,以及为什么任何文章都不该报价
你会看到一些指南列出每个模型、每秒钟的精确积分成本。把它们当作虚构内容看待。
成本会随模型、服务商和活动而变化。更重要的是,应用会在你生成之前从服务器获取真实报价——你看到的是当前设置下的实际价格,而不是别人几个月前写下的估算。
请在工具中查看报价。当前积分包价格见价格页面。其他一切都只是披着规格外衣的猜测。
不靠虚假基准表选择模型
没有人拥有可信的跨模型一致性评分,凡是发布精确到小数点后两位评分的文章,都是编出来的。真正可参考的是模型的能力和表现。
连续动作、同一世界: 通过链式生成使用 Seedance 2.5。正是为此打造。
基于角色参考图的独立镜头: 十三个参考生视频模型中的任意一个。Seedance、Veo 3.1 和 Wan 是大家最常用的。
精心设计的镜头运动: Kling 3.0 Motion Control。
衔接两个已知画面: Seedance 2.0 或 2.0 Fast,仅有这两个模型支持首尾帧。
探索阶段追求速度: Fast 和 Turbo 版本:Seedance 2.0 Fast、Kling 3.0 Turbo、Veo 3.1 Fast。探索时用便宜的,定稿时用贵的。
完整列表见模型。目前已上线四十四个视频模型,合适的选择取决于你在做上面哪一类工作。
收尾
在剪辑之后再提升分辨率,而不是之前,使用 Video Upscaler 即可。先放大再剪辑,等于花钱锐化那些最终会被剪掉的画面。
凡是要发到社交媒体的内容,都用自动字幕,因为大多数视频都是静音观看的。用 Shorts Generator 从成片中剪出竖屏版本。如果需要同一角色的动态主视觉海报,可以使用 Motion Poster。
仍然需要手艺的部分
以上这些都无法替代你对镜头用途的理解。
上述机制能让角色保持稳定,但它们不会决定摄像机该放在哪里、镜头停留多久,或者这场戏讲的是什么。连贯性是底线,而不是上限,而大多数 AI 视频连这条底线都达不到,所以解决它才值得投入这么多精力。
锁定角色,串联镜头,工具就不再和你作对。剩下的,才是真正的创作。
常见问题
为什么我的 AI 视频角色在镜头之间会变样?▾
因为每次生成都从零开始,根据你的文字重新想象角色。文字对人脸的描述必然有损:“深色头发、三十五岁左右、穿皮夹克的女性”能对应数百万人,所以模型每次都会挑一个不同的人。要保持一致,模型需要看到上一次的结果,而不是读到关于它的描述。
在每条提示词里重复角色描述有用吗?▾
有一点帮助,但解决不了问题。重复服装和名字能稍微引导模型,但纯靠文字生成的每个镜头仍然是一次全新的猜测。真正能在镜头间保持角色身份的,是参考图、首尾帧或链式生成。
Long Video Generator 中的链式生成是什么?▾
第一个片段根据你的角色参考图生成。之后的每个片段都会把上一个片段的成片作为视频参考,并从其最后一帧继续,角色参考图也会随每个片段一起传入。由于第一个镜头之后没有任何内容是从零重新想象的,角色身份和场景环境都能保持连贯。
哪些模型支持角色参考图?▾
共有十三个视频模型支持参考生视频,包括 Seedance 2.0 和 2.5、Veo 3.1 和 Veo 3.1 Lite、Wan 2.7、Wan 3.0 和 Wan 3.0 Prime、Kling 3.0 Motion Control、MiniMax H3、Happy Horse 以及 Gemini Omni Flash。参考图随请求一起发送,因此人脸是被“展示”给模型的,而不是被“描述”的。
如何让一个镜头接着另一个镜头继续?▾
使用首尾帧功能,Seedance 2.0 和 Seedance 2.0 Fast 支持。把上一个镜头的最后一帧作为起始帧,模型就会生成它与你指定的结束帧之间的运动,让剪辑衔接连贯,而不是生硬跳切。
一段角色一致的序列需要多少积分?▾
任何文章都不该告诉你具体数字,因为成本会随模型、服务商和活动而变化。应用会在你生成之前从服务器获取真实报价,让你看到当前设置下的实际价格。请在工具中查看报价,并前往价格页面了解当前积分包价格。
我应该用 Series Generator 还是 Long Video Generator?▾
在不同地点之间切换的独立场景适合用 Series Generator。一段连续不断的动作适合用 Long Video Generator 及其链式生成。选错就要重新渲染,所以开始之前先确定作品的形态。