AI 数字人实战:方案对比、驱动方式、素材要求与局限
做知识口播的时候,我研究过一轮数字人。结论是:它是目前 AI 视频里性价比最高的一块,但同时限制也很明确。这篇把选型和实操要点说清楚。
一、两类方案:云端 SaaS 和本地开源
| 维度 | 云端 SaaS(HeyGen、D-ID、腾讯智影一类) | 本地开源(MuseTalk、LivePortrait、Wav2Lip 一类) |
|---|---|---|
| 上手成本 | 低,上传素材点几下就出片 | 高,要配环境、下权重 |
| 计费 | 按分钟计费或订阅,大致几十到几百元一个月 | 一次性硬件投入,之后免费 |
| 效果上限 | 高,商用级口型和画质 | 中上,口型够用,画质看素材 |
| 可控性 | 低,只能用它给的模板和音色 | 高,参数随便调,能接自己的 TTS |
| 数据隐私 | 素材要上传 | 全本地 |
| 适合 | 想快速出片、量不大 | 量大、在意成本和数据 |
我的选择:量大且要固定形象的走本地,偶尔做几条或者要高质量成品的走云端。
二、三种驱动方式
- 音频驱动口型:给一段音频,让人物的嘴跟着动。这是最常用的一类,也是数字人口播的基础。口型同步精度现在做得相当好,配合本地 TTS,一条 3 分钟的口播可以全自动。
- 视频驱动:拍一段真人的动作视频,把动作迁移到目标人物上。用来做舞蹈视频、手势、表情。素材要求高,效果起伏也大。
- 模板驱动:平台预置的动作模板,比如站立讲解、坐姿播报、挥手。最省心,但动作很有限,看多了会腻。
三、素材要求
这块决定了成品下限,比模型选择更重要。
照片/视频素材:
- 正面、平视,脸不要有大幅侧转(超过 30 度基本崩)
- 光照均匀,别有大片阴影和逆光
- 无遮挡:头发不遮脸、不戴墨镜、手不挡嘴
- 分辨率 1080p 以上,越大越好
- 背景尽量简单,纯色或虚化背景最佳
- 做动作迁移的,肩膀要完整入镜,动作幅度别太大不要出画
音频素材:
- 干净无杂音,参考音频那套规则同样适用
- 语速均匀,别忽快忽慢
- 用本地 TTS 生成时,语速调到 0.95 到 1.05 之间最自然,太快嘴会跟不上
我常用的做法是先用 AI 生成一张满意的人物形象图,再拿它做数字人。好处是不用真人出镜,也不涉及肖像权问题。
四、适合什么场景
做得比较好的:
- 知识口播、产品讲解、课程录制。这是数字人的主场,画面简单、只需要嘴和表情。
- 多语种译制。同一段内容换十种语言,换音频就行,成本低到离谱。
- 客服问答、播报类内容。固定话术、固定形象。
- 舞蹈、变装这类短视频模板。玩法成熟,出片快。
五、绕不过去的局限
- 手部动作基本没法看。数字人手部崩坏是行业难题,所以别拍到手,构图卡在胸部以上。
- 多人同框很难。一个人能做好,两个人就互相干扰。
- 大动作和转身会崩。只能做小幅姿态变化和表情。
- 情绪表达弱。它能笑,但笑不出层次。需要感染力的内容,真人还是不可替代。
- 正脸侧转超过 30 度就变形。分镜设计时要避开。
- 缺乏临场感。观众看久了会觉得"假",所以数字人内容更依赖脚本质量,画面本身撑不起吸引力。
六、合规,一定要做
两条硬要求:
- 深度合成内容需要显著标识。国内对 AI 生成的音视频有标识要求,发布时按平台提示如实勾选。
- 用真人形象必须拿到肖像授权。这条是底线,尤其是商单。用 AI 生成的人物形象可以绕开这个问题,是目前比较干净的做法。
另外,生成的数字人形象如果要长期商用,注意看平台协议里对商用范围、是否保留水印的规定,各家差别不小。
七、结论
数字人现在最划算的用法是:把"出镜"这个环节自动化,把精力放在脚本和选题上。
它解决的是"我不想/不能出镜"的问题,解决不了"内容不好看"的问题。指望数字人救活一个烂脚本,基本没戏。