一周连发:Fable 5.1、Muse Spark 1.3、Qwen3.8-Max、GLM-5.3、混元 Hy4 谁更猛

这一周大模型发得像赶集。闭源旗舰、开源权重、国产主力几乎在同一时间段往外扔。我按实战能感知到的几条线,把这几个新面孔摊开说。

闭源这边

Claude Fable 5.1(Anthropic)在 Artificial Analysis 智能指数 max effort 下拿了 66 分,登顶。同天出的 Mythos 5.1 是同源模型,但安全护栏更紧,只走可信访问计划,给网络安全和生命科学领域的受审机构用。顺手把 API 缓存读取降价 75%,这招对长上下文应用很实在。

Meta 的 Muse Spark 1.3 是五个月里的第四个 Muse Spark 版本,迭代快得离谱。max 变体在 AA 指数拿到 62 分,xhigh 61 分,已经贴到 Claude 和 GPT-5.6 附近。

国产与开源

Qwen3.8-Max-0902(阿里)在 Code Arena 的 WebDev 榜拿了 1691 分,一亮相就总榜第一;混合价 5 美元每百万 token,是 Pareto 前沿上得分最高的。做前端的可以重点看。

GLM-5.3(智谱)开放了权重,主打智能体编程和防御性网络安全,AA 综合 60 分,和 Claude Fable 5、GPT-5.6 Sol 这些闭源旗舰挤在同一档。

腾讯混元 Hy4 preview 总参数 770B、激活 49B、上下文 1M,已经开源,上了腾讯云 TokenHub 和 OpenRouter。

顺带一提,DeepSeek 在 8 月 31 号于 Hugging Face 开源了首个多模态模型 DeepSeek-V4-Flash-Vision-Exp(MIT 许可),多模态 Agent 能力据称接近 Opus-4.8。

几个能记住的点

编码和 Agent 是这一波的主战场。Fable 5.1、Qwen3.8-Max、GLM-5.3 都在往"能干活"上堆能力。

开源权重在追,而且追得不慢。GLM-5.3、Hy4、DeepSeek-Vision 都能本地跑、能定制。

价格在被往下拽。缓存降价、混合计价、Pareto 前沿,大厂也在卷性价比,不再只拼绝对分数。

怎么选(务实版)

要最强综合:Fable 5.1、Muse Spark 1.3。

要前端和编码实战:Qwen3.8-Max。

要自己部署、可控可改:GLM-5.3、Hy4、DeepSeek-Vision。

要超长上下文:Hy4 的 1M 很能打。

模型迭代快到这种程度,选模型已经不是在挑"最好的",而是在挑"最贴合你接下来两三个月活儿的"。这周的发布清单,基本就是下半年能力线的预告片。

返回每日新闻