一周连发:Fable 5.1、Muse Spark 1.3、Qwen3.8-Max、GLM-5.3、混元 Hy4 谁更猛
这一周大模型发得像赶集。闭源旗舰、开源权重、国产主力几乎在同一时间段往外扔。我按实战能感知到的几条线,把这几个新面孔摊开说。
闭源这边
Claude Fable 5.1(Anthropic)在 Artificial Analysis 智能指数 max effort 下拿了 66 分,登顶。同天出的 Mythos 5.1 是同源模型,但安全护栏更紧,只走可信访问计划,给网络安全和生命科学领域的受审机构用。顺手把 API 缓存读取降价 75%,这招对长上下文应用很实在。
Meta 的 Muse Spark 1.3 是五个月里的第四个 Muse Spark 版本,迭代快得离谱。max 变体在 AA 指数拿到 62 分,xhigh 61 分,已经贴到 Claude 和 GPT-5.6 附近。
国产与开源
Qwen3.8-Max-0902(阿里)在 Code Arena 的 WebDev 榜拿了 1691 分,一亮相就总榜第一;混合价 5 美元每百万 token,是 Pareto 前沿上得分最高的。做前端的可以重点看。
GLM-5.3(智谱)开放了权重,主打智能体编程和防御性网络安全,AA 综合 60 分,和 Claude Fable 5、GPT-5.6 Sol 这些闭源旗舰挤在同一档。
腾讯混元 Hy4 preview 总参数 770B、激活 49B、上下文 1M,已经开源,上了腾讯云 TokenHub 和 OpenRouter。
顺带一提,DeepSeek 在 8 月 31 号于 Hugging Face 开源了首个多模态模型 DeepSeek-V4-Flash-Vision-Exp(MIT 许可),多模态 Agent 能力据称接近 Opus-4.8。
几个能记住的点
编码和 Agent 是这一波的主战场。Fable 5.1、Qwen3.8-Max、GLM-5.3 都在往"能干活"上堆能力。
开源权重在追,而且追得不慢。GLM-5.3、Hy4、DeepSeek-Vision 都能本地跑、能定制。
价格在被往下拽。缓存降价、混合计价、Pareto 前沿,大厂也在卷性价比,不再只拼绝对分数。
怎么选(务实版)
要最强综合:Fable 5.1、Muse Spark 1.3。
要前端和编码实战:Qwen3.8-Max。
要自己部署、可控可改:GLM-5.3、Hy4、DeepSeek-Vision。
要超长上下文:Hy4 的 1M 很能打。
模型迭代快到这种程度,选模型已经不是在挑"最好的",而是在挑"最贴合你接下来两三个月活儿的"。这周的发布清单,基本就是下半年能力线的预告片。