Claude Opus 5发布,Anthropic这次离「最强AI」还有多远
资讯动态 2 次阅读

Claude Opus 5发布,Anthropic这次离「最强AI」还有多远

Claude Opus 5发布,Anthropic这次离"最强AI"还有多远

就在上周五,Anthropic悄无声息地放了个大招——Claude Opus 5正式上线。说"悄无声息"其实不太准确,毕竟AI圈当天就直接炸了。

先说说这个模型的定位。Opus 5是Anthropic目前最强模型,在几乎所有第三方评测中,它的表现都跟Anthropic自家的顶级模型Fable 5不相上下,有些指标还略胜一筹。而且它有个巨大的优势——价格只有Fable的一半。2026年了,AI行业也卷起了性价比。

我花了不少时间研究各家评测数据,发现一个有意思的现象。在Artificial Analysis的AI评测指数上,Opus 5直接登顶了;Epoch的ECI能力指数给了它159分,只比Fable的161分低了一丢丢。而在软件工程能力这个维度上,SWE-ECI直接跟Fable打平,都是161分。

但更让我感兴趣的不是这些数字,而是实际测试里的表现。

有不少搞编程的同学已经在各种平台上试过了。有个开发者说,在自己的代码测试中,Opus 5用了best-of-n采样之后,表现"明显优于Fable"——注意,是优于,不是接近。还有人测试了Opus 5的浏览器操控能力,发现它能自动打开浏览器帮你取消ChatGPT订阅,操作行云流水。

当然,评测也不是一片叫好。有个细节被反复讨论——Opus 5在FrontierCode这个代码测试中,出现了"中努力模式比高努力模式分数更高"的现象。这确实有点反直觉,按理说算力投入越多结果应该越好。有人分析可能是测试本身的稳定性问题,也可能是模型在某些任务上的算力投入已经到了收益递减点。不管怎么说,这说明现在的评测基准本身也在"成长"——未必能完全反映真实模型能力。

说到定价,Opus 5的API定价比Opus 4要贵一些,但比起同级别的竞争对手还是便宜不少。考虑到它跟Fable相仿的性能水平,这个性价比确实能打。尤其在当前AI创业公司普遍"烧钱烧到手软"的背景下,一个能力强、价格友好的模型对行业绝对是好事。

Anthropic这家公司也挺有意思,一直走"安全第一"路线,每次发模型都要强调做了多少安全测试。这种谨慎在一部分人看来是负责任,在另一部分人看来就是"保守"。但说实话,从Opus 5的实际表现看,安全和能力并不是非此即彼的选择题——它完全可以在足够安全的前提下做到行业顶尖。

再说点个人感受。AI模型的迭代速度确实肉眼可见地在加速。半年前还是"某某模型吊打全场",半年后就变成"新模型又刷新了记录"。对开发者来说这是好事——更好的模型意味着更低的成本更多的尝试。对普通用户来说也是好事——竞争越激烈,价格就越亲民。

接下来AI圈的看点是什么?谷歌的Gemini系列估计也有新动作,Meta的开源模型还在蓄力,OpenAI那边肯定也不会坐视不管。反正这局棋,越下越精彩。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️