
今天 AI 圈最大的一件事
今天凌晨,阿里通义千问放了个大招:Qwen3.8-Max 正式发布。这可不是普通迭代——2.4 万亿总参数、约 95B 激活参数的 MoE 架构,1M 上下文窗口,直接对标开源界目前最大的一批模型。
更狠的是价格:API 输入每百万 token 只要 2 美元,输出 6 美元,缓存命中 0.25 美元。对比同级别的闭源模型,这基本是「骨折价」。而且官方明确承诺:下周开源,包括 Qwen3.8-Max 和更实用的 Qwen3.8-27B。
数字有多能打
看几个第三方评测:SWE-bench 87.3%,超过 GPT-5.5 的 82.6%;Frontend Code Arena 排第 4,跟 Claude Opus 5 基本持平;PaperBench 93.0 分。Vals Index 上它排开源模型第 2、总分 66.1,追平了 Claude Opus 4.7,但每次测试成本只有后者的不到一半。
除了跑分,这次宣传的几个场景更夸张:10 天以上的自主编程、芯片设计流程里 500 多轮优化迭代、模拟电商运营 365 天跑出 4.16 倍回报。虽然这些是官方口径,但至少说明模型的方向很明确——不跟你闲聊,专攻「干活」。
这事意味着什么
我的看法是,Qwen3.8-Max 的意义不在某一个分数,而在它把「开源模型的性能天花板」又抬了一截。加上 Kimi K3、GLM-5.2、DeepSeek 这一串名字,中国开源模型军团已经实打实地跟顶级闭源模型贴身肉搏了,而且是在编程、智能体这类最硬核的赛道上。
当然也有泼冷水的:2.4T 的大家伙,光加载权重就得 1TB 起步的内存,没个 8 张 H100 别想跑起来。所以对普通开发者来说,最实在的反而是那个 27B 的小模型——这个量级,一张好点的显卡就能玩起来。
下周开源之后,生态里估计又要热闹一阵子。到时候我实测一把,再回来跟大家汇报。反正这波,真有点「开源追平闭源」那味了。
评论 (0)
暂无评论,来写第一条吧 ✍️