AI 数字人实战:方案对比、驱动方式、素材要求与局限

做知识口播的时候,我研究过一轮数字人。结论是:它是目前 AI 视频里性价比最高的一块,但同时限制也很明确。这篇把选型和实操要点说清楚。

一、两类方案:云端 SaaS 和本地开源

维度云端 SaaS(HeyGen、D-ID、腾讯智影一类)本地开源(MuseTalk、LivePortrait、Wav2Lip 一类)
上手成本低,上传素材点几下就出片高,要配环境、下权重
计费按分钟计费或订阅,大致几十到几百元一个月一次性硬件投入,之后免费
效果上限高,商用级口型和画质中上,口型够用,画质看素材
可控性低,只能用它给的模板和音色高,参数随便调,能接自己的 TTS
数据隐私素材要上传全本地
适合想快速出片、量不大量大、在意成本和数据

我的选择:量大且要固定形象的走本地,偶尔做几条或者要高质量成品的走云端。

二、三种驱动方式

  1. 音频驱动口型:给一段音频,让人物的嘴跟着动。这是最常用的一类,也是数字人口播的基础。口型同步精度现在做得相当好,配合本地 TTS,一条 3 分钟的口播可以全自动。
  2. 视频驱动:拍一段真人的动作视频,把动作迁移到目标人物上。用来做舞蹈视频、手势、表情。素材要求高,效果起伏也大。
  3. 模板驱动:平台预置的动作模板,比如站立讲解、坐姿播报、挥手。最省心,但动作很有限,看多了会腻。

三、素材要求

这块决定了成品下限,比模型选择更重要。

照片/视频素材

  • 正面、平视,脸不要有大幅侧转(超过 30 度基本崩)
  • 光照均匀,别有大片阴影和逆光
  • 无遮挡:头发不遮脸、不戴墨镜、手不挡嘴
  • 分辨率 1080p 以上,越大越好
  • 背景尽量简单,纯色或虚化背景最佳
  • 做动作迁移的,肩膀要完整入镜,动作幅度别太大不要出画

音频素材

  • 干净无杂音,参考音频那套规则同样适用
  • 语速均匀,别忽快忽慢
  • 用本地 TTS 生成时,语速调到 0.95 到 1.05 之间最自然,太快嘴会跟不上

我常用的做法是先用 AI 生成一张满意的人物形象图,再拿它做数字人。好处是不用真人出镜,也不涉及肖像权问题。

四、适合什么场景

做得比较好的:

  1. 知识口播、产品讲解、课程录制。这是数字人的主场,画面简单、只需要嘴和表情。
  2. 多语种译制。同一段内容换十种语言,换音频就行,成本低到离谱。
  3. 客服问答、播报类内容。固定话术、固定形象。
  4. 舞蹈、变装这类短视频模板。玩法成熟,出片快。

五、绕不过去的局限

  1. 手部动作基本没法看。数字人手部崩坏是行业难题,所以别拍到手,构图卡在胸部以上。
  2. 多人同框很难。一个人能做好,两个人就互相干扰。
  3. 大动作和转身会崩。只能做小幅姿态变化和表情。
  4. 情绪表达弱。它能笑,但笑不出层次。需要感染力的内容,真人还是不可替代。
  5. 正脸侧转超过 30 度就变形。分镜设计时要避开。
  6. 缺乏临场感。观众看久了会觉得"假",所以数字人内容更依赖脚本质量,画面本身撑不起吸引力。

六、合规,一定要做

两条硬要求:

  1. 深度合成内容需要显著标识。国内对 AI 生成的音视频有标识要求,发布时按平台提示如实勾选。
  2. 用真人形象必须拿到肖像授权。这条是底线,尤其是商单。用 AI 生成的人物形象可以绕开这个问题,是目前比较干净的做法。

另外,生成的数字人形象如果要长期商用,注意看平台协议里对商用范围、是否保留水印的规定,各家差别不小。

七、结论

数字人现在最划算的用法是:把"出镜"这个环节自动化,把精力放在脚本和选题上

它解决的是"我不想/不能出镜"的问题,解决不了"内容不好看"的问题。指望数字人救活一个烂脚本,基本没戏。

返回AI视频创作