Gemini 推出 agentic 视频理解:模型能"边看边想"了

Google DeepMind 给 Gemini 加了一项新能力:agentic video understanding。名字有点绕,说人话就是——模型看视频的方式,从"看完再总结"变成了"边看边想、主动决策"。

以前的视频理解是什么样

传统做法很像考试里的阅读理解:你丢给模型一段视频,它从头扫到尾,然后给你一段摘要、几个时间戳、几个标签。它被动接收,一次性输出。

问题在这:视频不是文字,信息密度极不均匀。关键动作可能就藏在某一帧,或者某两个镜头之间的切换里。让模型"一口气看完再答",它会平均用力,反而把重点稀释了。

agentic 哪里不一样

agentic 的核心是"模型自己控制观看过程"。它可以决定:

  • 先看哪一帧,跳过哪些;
  • 看到可疑的地方,回退重看;
  • 针对一个问题,专门去某段里找证据;
  • 多轮追问,逐步收敛到答案。

相当于原来是个"交卷型考生",现在变成了"可以翻卷子、可以举手问澄清"的考生。这对长视频、监控、体育、教学这类内容特别有用——答案往往不在全局,而在某个局部细节。

能拿来干什么

几个立刻能想到的场景:

  • 长视频检索:别再靠标题和标签猜了,直接问"第三分钟那个人说了什么",模型自己去定位。
  • 监控与异常检测:让模型持续"盯"画面,发现异常再回看确认,而不是事后人工翻录像。
  • 教学/会议:一段两小时录播,问"哪里讲到了注意力机制的实现",它精准跳过去。
  • 内容审核:边看边判断,省掉全量人工复核。

我的判断

视频理解的瓶颈,一直不是"看不看得清",而是"知不知道该看哪"。agentic 把决策权交还给模型,等于补上了最后一块短板。

这也会倒逼上游——视频生成和视频理解本来是两条线,现在 Google 显然想把"生成"和"理解"打通:能生成,也能让另一个模型自己去理解生成出来的东西。闭环一旦形成,视频这条赛道会跑得比现在快得多。

对做视频内容的团队,这意味着以后"可被检索、可被问答"会成为基本功。拍完不是结束,而是被无数个 agent 反复观看、提问、引用的开始。

返回AI视频创作