全部文章
教程

用 AI 打造史诗级视频指南

主角在不同镜头之间换了一张脸。这是机制问题,不是提示词问题。真正能让角色在多个镜头间保持一致的三种方法。

作者:Flixly Team2026年3月26日
用 AI 打造史诗级视频指南

一句话总结

AI 视频中的角色之所以在镜头间走样,是因为每次生成都会根据文字重新想象角色,而文字对人脸的描述必然有损。有三种机制可以解决:参考图(12 个视频模型支持);首尾帧(Seedance 2.0 和 2.0 Fast 支持);以及链式生成,即每个片段都携带上一个片段的成片,并从其最后一帧继续。先锁定角色,因为之后的每个镜头都会继承它。

第一个镜头里,主角的左脸颊上有一道疤;第二个镜头里,疤不见了;到第四个镜头,连夹克都换了一件。

这才是 AI 视频真正的问题,而且它不是提示词的问题。你可以写出世界上最精确的角色描述,下一次生成照样会走样,因为每次生成都从零开始,根据文字重新想象你的角色。

史诗感意味着多个镜头同属一个世界。因此,整门手艺的核心就是连贯性,而连贯性是机制问题,不是措辞问题。

以下是真正能让角色在多个镜头间保持一致的方法。

为什么重复描述行不通

常见的建议是给角色起个名字,并在每条提示词里重复描述其服装。

这有一点帮助,但无法解决问题,因为文字对人脸的描述必然有损。“深色头发、三十五岁左右、穿皮夹克的女性”能对应数百万人,模型每次都会挑一个不同的人。

纯靠文字生成的每个镜头,都是一次全新的猜测。要保持一致,模型需要看到上一次的结果,而不是读到关于它的描述。

真正有效的三种机制

参考图。 给模型一张角色图片,而不是一段描述。共有十三个模型支持参考生视频,包括 Seedance 2.0 和 2.5、Veo 3.1、Wan 2.7、3.0 和 3.0 Prime、Kling 3.0 Motion Control、MiniMax H3 以及 Gemini Omni Flash。参考图随请求一起发送,因此人脸是被展示出来的,而不是被描述出来的。

首尾帧。 Seedance 2.0 和 Seedance 2.0 Fast 这两个模型可以同时接收起始帧和结束帧,并生成两者之间的运动。把第一个镜头的最后一帧交给第二个镜头,剪辑就会连贯衔接,而不是生硬跳切。

链式生成。 三者中最强的一种,也是 Long Video Generator 存在的原因。

链式生成如何运作

第一个片段根据你的角色参考图生成。之后的每个片段都会把上一个片段的成片作为视频参考,并从其最后一帧继续。角色参考图也会随每个片段一起传入。

这样,每个镜头都能看到两样东西:角色是谁,以及片刻之前世界的确切样子。由于第一个镜头之后没有任何内容是从零重新想象的,角色身份和场景环境都能保持连贯。

这就是四段“长得像”的人物片段与一部连贯作品之间的区别。该功能基于 Seedance 2.5 运行,完整教程见如何用 AI 制作长视频

一套稳得住的工作流程

在生成任何运动之前先锁定角色。 先得到一张你满意的角色图。之后的每个镜头都会继承它,所以一张平庸的参考图会影响整部作品。这一步值得投入真正的时间。

确定你需要的是独立镜头还是连续序列。 在不同地点之间切换的独立场景适合用 Series Generator。一段连续不断的动作适合用 Long Video Generator 及其链式生成。选错就得重新渲染,所以要慎重选择。

先测试一个片段,再决定做八个。 生成第一个片段,仔细检查它的最后一帧,只有没问题时才继续——因为在链式生成中,之后的每个片段都会继承这一帧。第一个片段的瑕疵,会出现在所有片段里。

把镜头运动和拍摄主体分开控制。 Kling 3.0 Motion Control 和运动控制正是为此而生。在主体提示词里描述镜头运动,往往两头都得不到。

最后再加对白。 先生成画面,再交给对口型。反过来做的话,任何一次重新生成都会让对口型的工作白费。

关于积分成本,以及为什么任何文章都不该报价

你会看到一些指南列出每个模型、每秒钟的精确积分成本。把它们当作虚构内容看待。

成本会随模型、服务商和活动而变化。更重要的是,应用会在你生成之前从服务器获取真实报价——你看到的是当前设置下的实际价格,而不是别人几个月前写下的估算。

请在工具中查看报价。当前积分包价格见价格页面。其他一切都只是披着规格外衣的猜测。

不靠虚假基准表选择模型

没有人拥有可信的跨模型一致性评分,凡是发布精确到小数点后两位评分的文章,都是编出来的。真正可参考的是模型的能力和表现。

连续动作、同一世界: 通过链式生成使用 Seedance 2.5。正是为此打造。

基于角色参考图的独立镜头: 十三个参考生视频模型中的任意一个。Seedance、Veo 3.1 和 Wan 是大家最常用的。

精心设计的镜头运动: Kling 3.0 Motion Control。

衔接两个已知画面: Seedance 2.0 或 2.0 Fast,仅有这两个模型支持首尾帧。

探索阶段追求速度: Fast 和 Turbo 版本:Seedance 2.0 Fast、Kling 3.0 Turbo、Veo 3.1 Fast。探索时用便宜的,定稿时用贵的。

完整列表见模型。目前已上线四十四个视频模型,合适的选择取决于你在做上面哪一类工作。

收尾

在剪辑之后再提升分辨率,而不是之前,使用 Video Upscaler 即可。先放大再剪辑,等于花钱锐化那些最终会被剪掉的画面。

凡是要发到社交媒体的内容,都用自动字幕,因为大多数视频都是静音观看的。用 Shorts Generator 从成片中剪出竖屏版本。如果需要同一角色的动态主视觉海报,可以使用 Motion Poster

仍然需要手艺的部分

以上这些都无法替代你对镜头用途的理解。

上述机制能让角色保持稳定,但它们不会决定摄像机该放在哪里、镜头停留多久,或者这场戏讲的是什么。连贯性是底线,而不是上限,而大多数 AI 视频连这条底线都达不到,所以解决它才值得投入这么多精力。

锁定角色,串联镜头,工具就不再和你作对。剩下的,才是真正的创作。

常见问题

为什么我的 AI 视频角色在镜头之间会变样?

因为每次生成都从零开始,根据你的文字重新想象角色。文字对人脸的描述必然有损:“深色头发、三十五岁左右、穿皮夹克的女性”能对应数百万人,所以模型每次都会挑一个不同的人。要保持一致,模型需要看到上一次的结果,而不是读到关于它的描述。

在每条提示词里重复角色描述有用吗?

有一点帮助,但解决不了问题。重复服装和名字能稍微引导模型,但纯靠文字生成的每个镜头仍然是一次全新的猜测。真正能在镜头间保持角色身份的,是参考图、首尾帧或链式生成。

Long Video Generator 中的链式生成是什么?

第一个片段根据你的角色参考图生成。之后的每个片段都会把上一个片段的成片作为视频参考,并从其最后一帧继续,角色参考图也会随每个片段一起传入。由于第一个镜头之后没有任何内容是从零重新想象的,角色身份和场景环境都能保持连贯。

哪些模型支持角色参考图?

共有十三个视频模型支持参考生视频,包括 Seedance 2.0 和 2.5、Veo 3.1 和 Veo 3.1 Lite、Wan 2.7、Wan 3.0 和 Wan 3.0 Prime、Kling 3.0 Motion Control、MiniMax H3、Happy Horse 以及 Gemini Omni Flash。参考图随请求一起发送,因此人脸是被“展示”给模型的,而不是被“描述”的。

如何让一个镜头接着另一个镜头继续?

使用首尾帧功能,Seedance 2.0 和 Seedance 2.0 Fast 支持。把上一个镜头的最后一帧作为起始帧,模型就会生成它与你指定的结束帧之间的运动,让剪辑衔接连贯,而不是生硬跳切。

一段角色一致的序列需要多少积分?

任何文章都不该告诉你具体数字,因为成本会随模型、服务商和活动而变化。应用会在你生成之前从服务器获取真实报价,让你看到当前设置下的实际价格。请在工具中查看报价,并前往价格页面了解当前积分包价格。

我应该用 Series Generator 还是 Long Video Generator?

在不同地点之间切换的独立场景适合用 Series Generator。一段连续不断的动作适合用 Long Video Generator 及其链式生成。选错就要重新渲染,所以开始之前先确定作品的形态。

本文提到的工具

AI视频教程内容创作视频生成角色一致性

准备好用教程创作了吗?

直接进入 Flixly 的 AI 工作室,用 50+ 个模型试试教程——免费上手。

用 AI 打造史诗级视频指南 | Flixly