🎯 一句话总结:先用 Codex 把一个 15 秒穿搭变装视频拆成制作单,再确认一张首帧,最后用低配测试版验证流程;不要一上来就做复杂分镜。

很多人不是没有想法,而是不知道第一步做什么。

你不需要先学导演、画画、剪辑,也不需要一开始就写专业提示词。先学会做几个小决定:题材能不能做、画面里有谁、动作是什么、哪一步已经确认。

本文用“一个主角、一个场景、10–15 秒的穿搭变装视频”贯穿。工具以 Codex、MiniMax H3 为例,也会说明换成 Seedance 2.5 时哪些步骤仍然复用。

先划清工具边界

  • AI 助手:Codex,或支持图片和视频分析的 ChatGPT。
  • 视频生成:MiniMax H3 或 Seedance 2.5 的可用界面。
  • 素材:一条想学习的视频,或一句自己的想法。
  • 保存位置:一个项目文件夹,保存参考图、制作单、提示词、视频和检查记录。

换工具时,下面这些步骤仍然复用:先分析、做制作单、确认首帧、低配试跑、按时间点反馈。

本文不展开 API 接入、复杂剪辑、多账号自动化,也不把多人物多分镜直接塞进第一条视频。

能力提示:原文以本地 MiniMax H3 为例,并提到 H3 的时长和首尾帧能力、Seedance 2.5 的多参考能力。具体上限、按钮和收费会随产品版本与入口变化,实际操作以当前界面和官方说明为准。

一、准备四样东西:先把范围缩小

准备:

  1. Codex 或支持图片生成的 ChatGPT。
  2. MiniMax H3 或 Seedance 2.5 的可用界面。
  3. 一条参考视频,或者一句自己的想法。
  4. 一个项目文件夹。

第一次只做:

  • 10–15 秒;
  • 一个主角;
  • 一个场景;
  • 一个连续动作:穿搭从日常服装变成另一套服装。

先别做:30 秒、多人物、复杂对白、多个地点、三段以上镜头。

确认闸门:你能用一句话说清“谁在什么地方完成什么变化”。能说清,再进入分析。

二、先分析,别急着生图

把参考视频链接或自己的想法交给 Codex。先让它判断玩法,不要马上生成素材。

可以直接复制:

我想做一条 10–15 秒的 AI 视频,主例子是“一个主角在一个场景中完成一次穿搭变装”。
请先不要生成图片,也不要写最终视频提示词。
请只分析:
1. 这个想法的核心动作是什么;
2. 主角、场景和镜头应该保持什么不变;
3. 哪些内容会让第一条视频变复杂;
4. 如果有参考视频,请按时间顺序列出 3–5 个关键变化。
最后给出一个适合第一次试跑的最小版本。

这一轮只确认:玩法是否是你想做的,人物和场景是否合适,视频有没有塞太多事情。

先别做:不要让 AI 同时生成首帧、尾帧、分镜、旁白和音乐方案。

确认闸门:只留下一个主角、一个场景和一个主要变化。否则回到这里删减。

三、把想法变成一张制作单

分析通过后,再让 Codex 输出普通人能检查的制作单:

根据刚才确认的最小版本,制作一张“AI 视频制作单”。
只保留一条 10–15 秒穿搭变装视频,包含:
- 主角外观与服装;
- 场景、时间和光线;
- 开始状态;
- 唯一主要动作;
- 结束状态;
- 首帧必须出现的内容;
- 视频提示词暂时不要写。
每一项都用普通人能检查的句子,不要使用“更自然”“更高级”这类无法验收的词。

穿搭例子的制作单可以是:

主角:一名成年人,固定发型和脸部特征。
场景:室内试衣区,固定机位和背景。
开始状态:穿日常服装,正面站立。
唯一动作:主角向镜头转身一次,服装完成一次变换。
结束状态:仍是同一主角、同一场景,穿变装后的服装。
首帧验收:只有一个完整人物;脸、手、脚没有明显错误;构图留出动作空间。

先别做:不要因为“尾帧”听起来专业就强行生成第二张图。只有结尾必须落在一个精确画面时,才需要尾帧。

确认闸门:制作单中每一项都能回答“对 / 不对”。不能检查的形容词删掉或改写。

四、只生成一张首帧测试图

制作单确认后,再让 Codex 或 ChatGPT 生成一张首帧。不要一次生成整套素材。

根据已确认的制作单,只生成一张视频首帧。
要求:一个主角、一个室内场景、正面站立、日常服装、固定机位。
不要加入第二个人、第二个场景、字幕、复杂道具或动作分镜。
生成后请只列出:人物数量、脸部状态、手脚状态、构图是否适合后续动作。

按这个顺序检查:

  1. 先数人数;
  2. 再看脸;
  3. 再看手脚;
  4. 最后看构图和光线。

先别做:不要因为画面第一眼漂亮,就直接进入视频生成。

如果只有一处错:

只修一个问题:人物右手出现多余手指。
保持人物、服装、场景、机位和光线不变,不要修改其它内容。

如果人物数量、脸和构图同时出错,直接重新生成通常比连续修补更省时间。

确认闸门:你能明确说出“首帧通过”,并且保存了这张图。通过后才写视频提示词。

AI 视频最小确认链:从分析到定点修复

五、根据已确认的首帧写视频提示词

把首帧交回 Codex。提示词要描述动作和边界,不要让模型重新设计人物。

这是已经确认的首帧。请只为这张图写一段 10–15 秒图生视频提示词。
保持人物身份、脸、服装起始状态、场景、机位和光线不变。
只描述一个连续动作:主角向镜头转身一次,完成一次穿搭变装,最后停在稳定姿态。
不要新增人物、地点、字幕、对白或第二个主要动作。
请同时列出 3 条禁止项,并说明动作大约发生在哪个时间段。

先别做:不要在提示词后面堆“更自然、更稳定、更高质量”。这类话不能告诉模型具体改什么。

确认闸门:提示词里只有一个主要动作,且与制作单、首帧一致。

六、先跑低配测试版

以 H3 为例,按当前界面选择:

  • 首帧图生视频;
  • 只上传确认后的首帧;
  • 画幅跟随首帧;
  • 时长选择 15 秒或当前可用的接近选项;
  • 粘贴 Codex 生成的提示词;
  • 先用较低分辨率生成测试版。

使用 Seedance 或其它模型时,按钮名称和参考图数量可能不同,但顺序不变:先上传已确认素材,再生成低风险测试版。

先别做:不要第一次就追求最高分辨率、最多参考图和最终成片质量。

确认闸门:测试版能完整播放,并且你知道问题发生在哪个时间点。能定位,才进入检查。

七、把视频交回 AI,要求它找具体错误

先自己完整看一遍,只记录真正让你出戏的问题。不要写“整体不自然”。

请检查这段测试视频,不要重写提示词。
按时间顺序列出最多 3 个最影响观感的问题。
每条必须包含:时间点、画面中的具体对象、实际发生了什么、建议优先修哪一个。
不要使用“更自然”“更高级”“更稳定”这类无法定位的描述。

合格的反馈像这样:

  • 00:04:转身开始后,人物比例突然放大,背景没有同步变化。
  • 00:07:变装过渡还没结束,白色描边仍停留在人物外侧。
  • 00:10:画面短暂出现两个完整人物。

先别做:不要一次列十几个问题,也不要同时改人物、动作、镜头、音乐和时长。

确认闸门:只选一个主问题,作为下一轮唯一修改目标。

八、一次只修一个问题

如果最影响观感的是转场太慢:

只修一个问题:00:04–00:07 的穿搭转场过慢。
保持首帧、人物、场景、镜头、时长和其它动作不变。
让服装在该时间段内完成一次连续变换,不新增人物或镜头。

重新生成后,把两个版本并排比较。你需要知道是哪一项修改带来了变化。

如果同一个错误连续出现两次,回到上游:检查首帧、动作设计和制作单。不要围着一条坏视频不断追加形容词。

完成这一轮的标准:你能说清“我只改了什么,问题是否改善,下一步是否还需要改”。

九、进阶:多人物、多分镜另开一条线

复杂剧情视频的难点不是“提示词写得长”,而是镜头之间的状态能不能接上:

  • 人物身份是否一致;
  • 人物站位和左右关系是否一致;
  • 道具有没有跳走;
  • 上一个镜头的动作能否接到下一个镜头;
  • 光线、视线和重心是否继承。

原文用公开的 cuimao_reverse 项目举例,逆向拆解“牛来”视频约 15 秒片段:动物外卖员一起吃饭,熊猫调侃牛,牛从假装没听见变成准备回应。该项目是根据公开视频做的教育性重建,不是原作者的原始工程或原始提示词。

复杂版本建议先拆:

  1. 故事变化;
  2. 角色设定;
  3. 配角阵容和站位;
  4. 场景空镜;
  5. 道具;
  6. 四格分镜;
  7. 每个镜头的开始状态和结束状态。

核心规则只有一句:前一个镜头的结束状态 = 后一个镜头的开始状态。

先别做:第一条穿搭视频还没跑通时,不要把多人物、多对白和多镜头整套搬过来。

完成标准 checklist

  • 图片、提示词、测试视频和检查记录保存在同一个项目文件夹。
  • 主题被缩小到 10–15 秒、一个主角、一个场景。
  • 已先分析,再制作单,没有直接跳到生图。
  • 已确认一张首帧,并检查人数、脸、手脚和构图。
  • 已用低配设置跑出一个能完整播放的测试版。
  • 每个问题都有步骤号或时间点,能够定位。
  • 每轮只修一个主问题。
  • 同一个错误连续出现两次时,已回到上游检查。

连续亲手跑通两三条视频后,再让 Codex 把已验证的流程整理成 Skill。不要第一天就自动化一套尚未验证的方法。

参考与说明