🎯 一句话总结:先用 Codex 把一个 15 秒穿搭变装视频拆成制作单,再确认一张首帧,最后用低配测试版验证流程;不要一上来就做复杂分镜。
很多人不是没有想法,而是不知道第一步做什么。
你不需要先学导演、画画、剪辑,也不需要一开始就写专业提示词。先学会做几个小决定:题材能不能做、画面里有谁、动作是什么、哪一步已经确认。
本文用“一个主角、一个场景、10–15 秒的穿搭变装视频”贯穿。工具以 Codex、MiniMax H3 为例,也会说明换成 Seedance 2.5 时哪些步骤仍然复用。
先划清工具边界
- AI 助手:Codex,或支持图片和视频分析的 ChatGPT。
- 视频生成:MiniMax H3 或 Seedance 2.5 的可用界面。
- 素材:一条想学习的视频,或一句自己的想法。
- 保存位置:一个项目文件夹,保存参考图、制作单、提示词、视频和检查记录。
换工具时,下面这些步骤仍然复用:先分析、做制作单、确认首帧、低配试跑、按时间点反馈。
本文不展开 API 接入、复杂剪辑、多账号自动化,也不把多人物多分镜直接塞进第一条视频。
能力提示:原文以本地 MiniMax H3 为例,并提到 H3 的时长和首尾帧能力、Seedance 2.5 的多参考能力。具体上限、按钮和收费会随产品版本与入口变化,实际操作以当前界面和官方说明为准。
一、准备四样东西:先把范围缩小
准备:
- Codex 或支持图片生成的 ChatGPT。
- MiniMax H3 或 Seedance 2.5 的可用界面。
- 一条参考视频,或者一句自己的想法。
- 一个项目文件夹。
第一次只做:
- 10–15 秒;
- 一个主角;
- 一个场景;
- 一个连续动作:穿搭从日常服装变成另一套服装。
先别做:30 秒、多人物、复杂对白、多个地点、三段以上镜头。
确认闸门:你能用一句话说清“谁在什么地方完成什么变化”。能说清,再进入分析。
二、先分析,别急着生图
把参考视频链接或自己的想法交给 Codex。先让它判断玩法,不要马上生成素材。
可以直接复制:
我想做一条 10–15 秒的 AI 视频,主例子是“一个主角在一个场景中完成一次穿搭变装”。
请先不要生成图片,也不要写最终视频提示词。
请只分析:
1. 这个想法的核心动作是什么;
2. 主角、场景和镜头应该保持什么不变;
3. 哪些内容会让第一条视频变复杂;
4. 如果有参考视频,请按时间顺序列出 3–5 个关键变化。
最后给出一个适合第一次试跑的最小版本。
这一轮只确认:玩法是否是你想做的,人物和场景是否合适,视频有没有塞太多事情。
先别做:不要让 AI 同时生成首帧、尾帧、分镜、旁白和音乐方案。
确认闸门:只留下一个主角、一个场景和一个主要变化。否则回到这里删减。
三、把想法变成一张制作单
分析通过后,再让 Codex 输出普通人能检查的制作单:
根据刚才确认的最小版本,制作一张“AI 视频制作单”。
只保留一条 10–15 秒穿搭变装视频,包含:
- 主角外观与服装;
- 场景、时间和光线;
- 开始状态;
- 唯一主要动作;
- 结束状态;
- 首帧必须出现的内容;
- 视频提示词暂时不要写。
每一项都用普通人能检查的句子,不要使用“更自然”“更高级”这类无法验收的词。
穿搭例子的制作单可以是:
主角:一名成年人,固定发型和脸部特征。
场景:室内试衣区,固定机位和背景。
开始状态:穿日常服装,正面站立。
唯一动作:主角向镜头转身一次,服装完成一次变换。
结束状态:仍是同一主角、同一场景,穿变装后的服装。
首帧验收:只有一个完整人物;脸、手、脚没有明显错误;构图留出动作空间。
先别做:不要因为“尾帧”听起来专业就强行生成第二张图。只有结尾必须落在一个精确画面时,才需要尾帧。
确认闸门:制作单中每一项都能回答“对 / 不对”。不能检查的形容词删掉或改写。
四、只生成一张首帧测试图
制作单确认后,再让 Codex 或 ChatGPT 生成一张首帧。不要一次生成整套素材。
根据已确认的制作单,只生成一张视频首帧。
要求:一个主角、一个室内场景、正面站立、日常服装、固定机位。
不要加入第二个人、第二个场景、字幕、复杂道具或动作分镜。
生成后请只列出:人物数量、脸部状态、手脚状态、构图是否适合后续动作。
按这个顺序检查:
- 先数人数;
- 再看脸;
- 再看手脚;
- 最后看构图和光线。
先别做:不要因为画面第一眼漂亮,就直接进入视频生成。
如果只有一处错:
只修一个问题:人物右手出现多余手指。
保持人物、服装、场景、机位和光线不变,不要修改其它内容。
如果人物数量、脸和构图同时出错,直接重新生成通常比连续修补更省时间。
确认闸门:你能明确说出“首帧通过”,并且保存了这张图。通过后才写视频提示词。

五、根据已确认的首帧写视频提示词
把首帧交回 Codex。提示词要描述动作和边界,不要让模型重新设计人物。
这是已经确认的首帧。请只为这张图写一段 10–15 秒图生视频提示词。
保持人物身份、脸、服装起始状态、场景、机位和光线不变。
只描述一个连续动作:主角向镜头转身一次,完成一次穿搭变装,最后停在稳定姿态。
不要新增人物、地点、字幕、对白或第二个主要动作。
请同时列出 3 条禁止项,并说明动作大约发生在哪个时间段。
先别做:不要在提示词后面堆“更自然、更稳定、更高质量”。这类话不能告诉模型具体改什么。
确认闸门:提示词里只有一个主要动作,且与制作单、首帧一致。
六、先跑低配测试版
以 H3 为例,按当前界面选择:
- 首帧图生视频;
- 只上传确认后的首帧;
- 画幅跟随首帧;
- 时长选择 15 秒或当前可用的接近选项;
- 粘贴 Codex 生成的提示词;
- 先用较低分辨率生成测试版。
使用 Seedance 或其它模型时,按钮名称和参考图数量可能不同,但顺序不变:先上传已确认素材,再生成低风险测试版。
先别做:不要第一次就追求最高分辨率、最多参考图和最终成片质量。
确认闸门:测试版能完整播放,并且你知道问题发生在哪个时间点。能定位,才进入检查。
七、把视频交回 AI,要求它找具体错误
先自己完整看一遍,只记录真正让你出戏的问题。不要写“整体不自然”。
请检查这段测试视频,不要重写提示词。
按时间顺序列出最多 3 个最影响观感的问题。
每条必须包含:时间点、画面中的具体对象、实际发生了什么、建议优先修哪一个。
不要使用“更自然”“更高级”“更稳定”这类无法定位的描述。
合格的反馈像这样:
00:04:转身开始后,人物比例突然放大,背景没有同步变化。00:07:变装过渡还没结束,白色描边仍停留在人物外侧。00:10:画面短暂出现两个完整人物。
先别做:不要一次列十几个问题,也不要同时改人物、动作、镜头、音乐和时长。
确认闸门:只选一个主问题,作为下一轮唯一修改目标。
八、一次只修一个问题
如果最影响观感的是转场太慢:
只修一个问题:00:04–00:07 的穿搭转场过慢。
保持首帧、人物、场景、镜头、时长和其它动作不变。
让服装在该时间段内完成一次连续变换,不新增人物或镜头。
重新生成后,把两个版本并排比较。你需要知道是哪一项修改带来了变化。
如果同一个错误连续出现两次,回到上游:检查首帧、动作设计和制作单。不要围着一条坏视频不断追加形容词。
完成这一轮的标准:你能说清“我只改了什么,问题是否改善,下一步是否还需要改”。
九、进阶:多人物、多分镜另开一条线
复杂剧情视频的难点不是“提示词写得长”,而是镜头之间的状态能不能接上:
- 人物身份是否一致;
- 人物站位和左右关系是否一致;
- 道具有没有跳走;
- 上一个镜头的动作能否接到下一个镜头;
- 光线、视线和重心是否继承。
原文用公开的 cuimao_reverse 项目举例,逆向拆解“牛来”视频约 15 秒片段:动物外卖员一起吃饭,熊猫调侃牛,牛从假装没听见变成准备回应。该项目是根据公开视频做的教育性重建,不是原作者的原始工程或原始提示词。
复杂版本建议先拆:
- 故事变化;
- 角色设定;
- 配角阵容和站位;
- 场景空镜;
- 道具;
- 四格分镜;
- 每个镜头的开始状态和结束状态。
核心规则只有一句:前一个镜头的结束状态 = 后一个镜头的开始状态。
先别做:第一条穿搭视频还没跑通时,不要把多人物、多对白和多镜头整套搬过来。
完成标准 checklist
- 图片、提示词、测试视频和检查记录保存在同一个项目文件夹。
- 主题被缩小到 10–15 秒、一个主角、一个场景。
- 已先分析,再制作单,没有直接跳到生图。
- 已确认一张首帧,并检查人数、脸、手脚和构图。
- 已用低配设置跑出一个能完整播放的测试版。
- 每个问题都有步骤号或时间点,能够定位。
- 每轮只修一个主问题。
- 同一个错误连续出现两次时,已回到上游检查。
连续亲手跑通两三条视频后,再让 Codex 把已验证的流程整理成 Skill。不要第一天就自动化一套尚未验证的方法。
参考与说明
- 原始 X Article:Michael Guo
- cuimao_reverse 项目
- 本文工具名称、模型能力和界面选项可能随版本变化;实际使用前请以对应产品的当前官方说明为准。