AI 短视频流水线:脚本到成片的六步,每步用什么、注意什么
这篇写的是我现在做一条 1 分钟 AI 短视频的完整流程,六个环节串下来,重点说每步用什么、哪些地方容易翻车。
一、脚本:先定结构再写词
60 秒的口播或故事,字数控制在 180 到 240 字,语速正常的话刚好一分钟。
结构我一般按四段走:
- 前 3 秒钩子:一句反常识的话、一个问题、一个画面。
- 中间展开:2 到 3 个点,每点一句话讲完。
- 转折或高潮:情绪最高的一句。
- 结尾:一句总结或者一个行动指引。
用 AI 写脚本时,别让它"写一篇短视频脚本"。把上面这个结构、字数、受众、语气一起给它,出来的东西能直接用。写完自己念一遍,拗口的地方一定改,后期改不起。
二、分镜:把脚本拆成镜头表
这一步最容易被跳过,也最值得做。格式很简单:
| 镜号 | 画面描述 | 旁白 | 时长 |
|---|---|---|---|
| 1 | 女孩背对着镜头推开木门,清晨的光从门缝进来 | “她以为只是普通的一天” | 3s |
| 2 | 中景,女孩回头,表情惊讶 | “直到看见桌上那封信” | 3s |
几个原则:
- 1 分钟大概 12 到 20 个镜头,单个镜头 3 到 5 秒。
- 画面描述只写镜头里能看到的东西,别写情绪和主题,模型理解不了。
- 每段旁白对应一个镜头,方便后面对齐。
三、生图:锁定角色是核心
- 先单独生成主角形象,挑一张满意的当参考图,后面所有镜头都带着它。
- 角色描述词固定成一个模板,每次原样复制:“25 岁亚洲女性,黑色齐肩发,米色风衣,室内暖光,写实摄影风格”。
- 同一个镜头生成 4 到 8 张,挑一张。
- 出图后先检查手、手指、文字、五官对称,这几处最容易崩,废图直接重来,别指望后期修。
四、生视频:图生视频为主
- 把每张分镜图丢进去,写清楚"镜头怎么动":推、拉、摇、移、固定。
- 单次生成 5 秒左右,超了容易变形。
- 一条生成 3 到 6 次挑一条,这是正常的,别怀疑人生。
- 先低分辨率验证动作方向,选中了再高清重跑。
时间主要花在这一步,1 分钟成片,光生视频可能要一到两小时。
五、配音:本地 TTS 更划算
两条路:
- 云端配音 API:方便,按字数计费,量小的时候省心。
- 本地开源 TTS:量大之后几乎零成本,声音还能固定成角色音。
我的做法是用本地引擎配旁白,配乐单独找,最后在剪辑里混。混音时注意人声比背景音乐高 6 到 10 个 dB,不然听不清。
配音前把文本里的数字和英文改成中文写法,能少一半返工。这一步的细节在站里《长文本配音流水线》那篇里写了。
六、合成剪辑
工具用剪映或者 ffmpeg 都行,流程固定:
- 按分镜表摆好视频片段,粗剪一遍看节奏。
- 铺旁白,按旁白调整每个镜头的时长。
- 加背景音乐,音量压到 -25 到 -20 dB 左右。
- 加字幕,字幕按句断,别按字断。
- 加转场,硬切为主,每 5 到 8 个镜头用一次转场就够了。
- 调色统一:所有片段套同一个滤镜或者 LUT,能盖掉一部分生成差异。
ffmpeg 拼接的常规做法:
# 先建一个列表文件
# file 'clip01.mp4'
# file 'clip02.mp4'
ffmpeg -f concat -safe 0 -i list.txt -c copy raw.mp4
# 混音:人声 + 背景音乐
ffmpeg -i raw.mp4 -i voice.mp3 -i bgm.mp3 \
-filter_complex "[1]volume=1.0[a];[2]volume=0.15[b];[a][b]amix=inputs=2[aout]" \
-map 0:v -map "[aout]" -shortest out.mp4
七、时间和成本账
1 分钟成片,大概的投入:
- 脚本加分镜:20 到 40 分钟
- 生图:30 到 60 分钟
- 生视频:1 到 2 小时
- 配音:10 到 20 分钟
- 剪辑:30 分钟到 1 小时
合计 2 到 4 小时。成本主要在生视频的抽卡上,其余环节都很便宜。
八、给新手的两条起步建议
- 先从 15 秒的做起。一分钟的做下来容易半途而废,15 秒能完整跑通流程,成就感来得快。
- 先做不需要人物一致性的题材。风景、产品、美食、知识口播,比做剧情故事容易十倍。等流程熟了再上人物。