AI 短视频流水线:脚本到成片的六步,每步用什么、注意什么

这篇写的是我现在做一条 1 分钟 AI 短视频的完整流程,六个环节串下来,重点说每步用什么、哪些地方容易翻车。

一、脚本:先定结构再写词

60 秒的口播或故事,字数控制在 180 到 240 字,语速正常的话刚好一分钟。

结构我一般按四段走:

  1. 前 3 秒钩子:一句反常识的话、一个问题、一个画面。
  2. 中间展开:2 到 3 个点,每点一句话讲完。
  3. 转折或高潮:情绪最高的一句。
  4. 结尾:一句总结或者一个行动指引。

用 AI 写脚本时,别让它"写一篇短视频脚本"。把上面这个结构、字数、受众、语气一起给它,出来的东西能直接用。写完自己念一遍,拗口的地方一定改,后期改不起。

二、分镜:把脚本拆成镜头表

这一步最容易被跳过,也最值得做。格式很简单:

镜号画面描述旁白时长
1女孩背对着镜头推开木门,清晨的光从门缝进来“她以为只是普通的一天”3s
2中景,女孩回头,表情惊讶“直到看见桌上那封信”3s

几个原则:

  • 1 分钟大概 12 到 20 个镜头,单个镜头 3 到 5 秒。
  • 画面描述只写镜头里能看到的东西,别写情绪和主题,模型理解不了。
  • 每段旁白对应一个镜头,方便后面对齐。

三、生图:锁定角色是核心

  1. 先单独生成主角形象,挑一张满意的当参考图,后面所有镜头都带着它。
  2. 角色描述词固定成一个模板,每次原样复制:“25 岁亚洲女性,黑色齐肩发,米色风衣,室内暖光,写实摄影风格”。
  3. 同一个镜头生成 4 到 8 张,挑一张。
  4. 出图后先检查手、手指、文字、五官对称,这几处最容易崩,废图直接重来,别指望后期修。

四、生视频:图生视频为主

  • 把每张分镜图丢进去,写清楚"镜头怎么动":推、拉、摇、移、固定。
  • 单次生成 5 秒左右,超了容易变形。
  • 一条生成 3 到 6 次挑一条,这是正常的,别怀疑人生。
  • 先低分辨率验证动作方向,选中了再高清重跑。

时间主要花在这一步,1 分钟成片,光生视频可能要一到两小时。

五、配音:本地 TTS 更划算

两条路:

  1. 云端配音 API:方便,按字数计费,量小的时候省心。
  2. 本地开源 TTS:量大之后几乎零成本,声音还能固定成角色音。

我的做法是用本地引擎配旁白,配乐单独找,最后在剪辑里混。混音时注意人声比背景音乐高 6 到 10 个 dB,不然听不清。

配音前把文本里的数字和英文改成中文写法,能少一半返工。这一步的细节在站里《长文本配音流水线》那篇里写了。

六、合成剪辑

工具用剪映或者 ffmpeg 都行,流程固定:

  1. 按分镜表摆好视频片段,粗剪一遍看节奏。
  2. 铺旁白,按旁白调整每个镜头的时长。
  3. 加背景音乐,音量压到 -25 到 -20 dB 左右。
  4. 加字幕,字幕按句断,别按字断。
  5. 加转场,硬切为主,每 5 到 8 个镜头用一次转场就够了。
  6. 调色统一:所有片段套同一个滤镜或者 LUT,能盖掉一部分生成差异。

ffmpeg 拼接的常规做法:

# 先建一个列表文件
# file 'clip01.mp4'
# file 'clip02.mp4'
ffmpeg -f concat -safe 0 -i list.txt -c copy raw.mp4

# 混音:人声 + 背景音乐
ffmpeg -i raw.mp4 -i voice.mp3 -i bgm.mp3 \
  -filter_complex "[1]volume=1.0[a];[2]volume=0.15[b];[a][b]amix=inputs=2[aout]" \
  -map 0:v -map "[aout]" -shortest out.mp4

七、时间和成本账

1 分钟成片,大概的投入:

  • 脚本加分镜:20 到 40 分钟
  • 生图:30 到 60 分钟
  • 生视频:1 到 2 小时
  • 配音:10 到 20 分钟
  • 剪辑:30 分钟到 1 小时

合计 2 到 4 小时。成本主要在生视频的抽卡上,其余环节都很便宜。

八、给新手的两条起步建议

  1. 先从 15 秒的做起。一分钟的做下来容易半途而废,15 秒能完整跑通流程,成就感来得快。
  2. 先做不需要人物一致性的题材。风景、产品、美食、知识口播,比做剧情故事容易十倍。等流程熟了再上人物。
返回AI视频创作