如何制作 5 秒视频
没有运动强度滑块。提示词就是你的控制面板,下面教你如何写出一条在第二次尝试时就能得到可用 5 秒片段的提示词。

一句话总结
在全部 37 个视频生成模型中,真正可用的控制项是提示词、时长、画面比例和分辨率,部分模型还支持参考图、负面提示词或首尾帧。没有运动强度、引导系数或插帧设置,所以几乎所有工作都靠提示词完成。生成前先选好时长和画面比例,把提示词写成带有镜头描述的单一动作,先用 Fast 版本探索,再用完整模型出成片。
没有运动强度滑块。没有引导系数,没有 motion bucket,也没有插帧设置。
在平台全部 37 个视频生成模型中,你真正能用到的控制项是:提示词、时长、画面比例、分辨率,另外根据模型不同,还有参考图、负面提示词或首尾帧。
这就是全部。对于 5 秒片段来说,这一点至关重要,因为这意味着几乎所有工作都由提示词完成,你花在寻找滑块上的每一分钟,都是没有用来修改句子的一分钟。
下面是真正做出一段优质 5 秒视频的方法。
生成前先确定画面形态
有两项设置只需选一次,而且之后不重新生成就无法修改:
时长。 5 秒成为最佳时长是有原因的。视频模型在短时间内能保持连贯,时间一长就会失去连贯性,所以 5 秒片段能让你每个积分换到最好的运动质量。
画面比例。 如果片段要发到 Reels、Shorts 或 TikTok,一开始就选竖屏。事后把 16:9 的片段裁成 9:16,会丢掉三分之二的画面,以及模型做出的所有构图决策。
这两项选错,是第一次尝试被废弃的最常见原因。
像写分镜表一样写提示词
既然提示词就是控制面板,就按导演描述镜头的方式来组织它:先写主体,再写它在做什么,然后写光线和构图。
“香水瓶在反光的黑色表面上缓慢旋转,顶部柔光箱照明,浅景深,镜头保持静止。”
让简短提示词奏效的三个要点:
一个动作,而不是三个。 5 秒只够容纳一个动作。同时要求摇镜、推镜和主体转身的提示词,只会给你一团三者都很仓促的混乱画面。
写明镜头在做什么。 “镜头保持静止”是一条指令。省略它,模型就会自己编造运动,大多数漂移都来源于此。
描述结束状态。 “最后一帧停留在标签上”给了模型一个落点,而不是在动作中途切断。
如果模型支持负面提示词,那才是去除不想要元素的真正手段:抖动、文字伪影、多余的肢体。它是一个真实存在的参数,不像其他教程编造出来的那些滑块。
从合适的工具开始
从零生成片段,用文字转视频。Video Generator 是基于同一模型目录、功能更全面的工作区。
如果你已经有一张满意的静态图,图片转视频可以让它动起来,想要特定画面风格时,这通常比从头描述那种风格更快。
如果你清楚知道镜头从哪里开始、到哪里结束,首尾帧生成会根据你提供的两张图片生成中间的运动。只有 Seedance 2.0 和 Seedance 2.0 Fast 支持此功能,它也是平台上制作短片段时可控性最强的选项。
按模型表现选择,而不是看跑分表
你会看到一些文章用表格列出每个模型的生成时间和文件大小。那些数字是编造的,而且无论如何都会很快过时。速度随负载变化,文件大小随内容变化。
稳定不变的是模型的表现:
- Fast 和 Turbo 版本(Seedance 2.0 Fast、Kling 3.0 Turbo、Veo 3.1 Fast)用于探索。尝试成本低,出结果快。
- 完整模型(Seedance 2.5、Kling 3.0、Veo 3.1)在提示词确定后使用。
- 基于参考图的创作:当特定人脸或产品必须保持一致时,使用 13 个支持参考图的模型中的任意一个。
用便宜的模型探索,用贵的模型出成片。完整目录见模型,应用会在你确认前报出每次生成的费用,所以你永远不必猜。
迭代提示词,而不是设置
片段效果不对时,人的本能是去找一个旋钮。但根本没有。去改句子。
| 出了什么问题 | 应该改什么 |
|---|---|
| 镜头本该固定却在漂移 | 加上“镜头静止”或“固定机位” |
| 动作太急躁 | 描述更慢的动作,而不是缩短时长 |
| 主体在片段中途变形 | 用一张你已经满意的静态图做图片转视频 |
| 画面里出现了不该有的东西 | 如果模型支持,把它写进负面提示词 |
| 片段停在动作中途 | 明确描述最后一帧 |
用更好的句子重新生成,胜过用同一句话抱着侥幸心理重新生成。模型具有随机性,所以用同样的骰子再掷一次有时会有帮助,但这是解决提示词问题最昂贵的方式。
声音、字幕与最后一步
生成的视频是无声的,除非模型支持 generate_audio 且你要求了生成音频。
Music Generation 能为你提供不会因版权问题导致作品被静音的背景音乐。Auto Captions 会把文字烧录进画面,这在社交媒体上并非可有可无,因为大多数内容都是静音观看的,没有字幕的片段对大部分观众来说就是无声片段。
如果你是从更长的视频中剪辑而不是生成,Shorts Generator 能找出精彩片段并渲染逐字字幕,字幕可放在顶部、中间或底部。
你生成的所有内容都在历史记录中,当客户要“上周那个”时,直接去那里找,而不是试图用 seed 重新生成。
真实的五分钟流程
- 确定时长和画面比例。
- 像写分镜表一样写提示词,只写一个动作。
- 用 Fast 版本生成。客观地审视结果。
- 不对?改写句子,而不是设置。重复直到画面形态正确。
- 对了?用完整模型重新生成一次。
- 加字幕,需要的话加音乐,完成。
大部分时间都花在第 4 步,而这正是时间该花的地方。
5 秒做不到的事
5 秒无法讲述一个有开头有结尾的故事。它能做的是清楚地展示一件正在发生的事。
适合这个时长的片段包括:旋转的产品、成形的标志、做出反应的人脸、打开的门。失败的片段则是那些试图把一段叙事压缩进一个根本容不下它的时长里的。
如果你需要一段连续的镜头序列,就生成多个短片段再剪辑到一起,而不是要求一次生成涵盖全部内容。短片段失败成本低,而且好剪辑。长片段会在中途失去连贯性,一旦出问题,代价也最高。
常见问题
生成视频时,我实际能控制哪些设置?▾
大多数模型支持提示词、时长、画面比例和分辨率,另外根据模型不同,还支持参考图、负面提示词或首尾帧。37 个视频生成模型中没有任何一个提供运动强度、引导系数、motion bucket 或插帧设置,所以列出这些数值的教程,描述的是根本不存在的控制项。
想要静止镜头时,如何让镜头不乱动?▾
直接在提示词里写明。“镜头静止”或“固定机位”是模型会遵循的指令。如果不指定镜头运动,模型就会自己编造运动,大多数不想要的漂移都来源于此。
为什么我的 5 秒片段看起来很仓促?▾
通常是因为提示词要求了不止一个动作。5 秒只够容纳一个动作。同时要求摇镜、推镜和主体转身的提示词,只会得到三者都很仓促的版本。只描述一个动作,以及你希望片段最终停留的状态。
应该在生成前选择竖屏还是横屏?▾
生成之前。画面比例在生成时就已确定,事后裁剪会丢掉大部分画面,连同模型选定的构图一起丢掉。如果片段要发到 Reels、Shorts 或 TikTok,从一开始就生成竖屏。
制作短片段应该用哪个模型?▾
先用 Seedance 2.0 Fast、Kling 3.0 Turbo 或 Veo 3.1 Fast 这类 Fast 或 Turbo 版本探索,提示词确定后再用完整模型重新生成一次。需要保持特定人脸或产品时,使用 13 个参考图生视频模型之一;需要精确的起点和终点时,使用 Seedance 2.0 或 2.0 Fast,它们是仅有的两个支持首尾帧的模型。
片段效果不对,我该改什么?▾
改句子,而不是改设置,因为根本没有可调的设置。镜头漂移就加上镜头指令,动作太急就描述更慢的动作,主体变形就用图片转视频从一张静态图开始,片段停在动作中途就明确描述最后一帧。
生成的视频有声音吗?▾
不会,除非模型支持音频生成且你要求了生成音频。否则片段是无声的,你可以通过 Music Generation 添加音轨。对社交媒体而言,Auto Captions 生成的字幕比音乐更重要,因为大多数短视频都是静音观看的。