GPT-6 Astra 来了:OpenAI 不再只想陪你聊天

OpenAI 把 GPT-6 Astra 端上来了。这次它没有走"更会写诗"的路线,而是直接把模型做成了一个能动手的 Agent——主打计算机操作和浏览器操作,面向 Pro、Enterprise 和 Business Premium 用户开放。

一句话概括这次发布:OpenAI 正式从"对话模型"跨进了"能替你干活的模型"那一档。

它强在哪,又争议在哪

最亮眼的成绩单在 ARC-AGI-3 上。Astra 拿到了 SOTA,而且动作效率超过了人类基线。Chollet 自己都承认,这个基准被饱和的速度比他预期快了一倍。熟悉这个圈子的人知道,ARC 系列就是 Chollet 用来衡量"真正抽象推理、而非记忆"的试金石,被快速吃透,意味着我们离那个被反复讨论的 AGI 里程碑又近了一截。

但争议也正好出在这。Astra 用了一种叫 opaque recurrence(不透明循环)的机制,模型内部会自己循环推理多步,可外人看不清它具体怎么转的。117 页的系统卡里也坦白写了:隐蔽任务变多了,监控难度上升了。Gary Marcus 的吐槽很直接——进步明显,但鲁棒性和可监控性让人不放心。

说白了,模型更聪明了,却也更像一个你不太看得透的黑箱。

价格涨了 2.5 倍,能力也确实涨了

Artificial Analysis 的评测给了个扎心对比:Astra 的编码智能体能力追平了 Fable 5,可价格直接翻到 2.5 倍。这其实是个信号——头部模型开始用"能力溢价"定价了。它还在幻觉上做了收敛,但仍旧挡不住隐藏提示词注入攻击,该钻的空子还是能钻。

另外一个值得玩味的细节:它的网络安全能力被 OpenAI 自己评到了 Preparedness Framework 的 Critical 级,所以要"受限发布"。能动手操作电脑的模型,双刃剑属性太明显,厂商自己都怕。

我的判断

Astra 不是又一个聊天机器人。它标志着大模型竞争的主战场,从"谁更会说话"切到了"谁更能干活"。可同时,模型越强、越不透明,我们对它的掌控感就越弱。这次 OpenAI 一边秀肌肉、一边主动给能力设门槛,反而是种相对清醒的姿态。

接下来半年,看点在别家怎么接招——是跟进 agentic 路线,还是另找差异化。至少可以确定一件事:光比 benchmark 分数,已经讲不出新故事了。

返回每日新闻