实测 30 个任务:DeepSeek V4 Flash 配哪个编程 AI 最好用?
技术笔记 7 次阅读

实测 30 个任务:DeepSeek V4 Flash 配哪个编程 AI 最好用?

有人拿 30 个真实任务测了一圈

这几天 DeepSeek V4 Flash 正式版上线,圈子里都在讨论一个问题:这模型到底配哪个编程智能体框架最好使?光看跑分没啥意思,大家更想知道实际干活谁靠谱。

结果 Composio 先动手了。8 月 6 号他们在 X 上发了一组测试,用 Gmail、GitHub、Slack、Notion 这些真实工具跑了 30 个智能体任务,四个框架统一调用 DeepSeek V4 Flash 正式版,结果还挺有意思。

成绩单:没有全能冠军

先看结果:Oh My Pi 拿下 17/30,成功率最高;Claude Code 和 Codex 都是 16/30,咬得很紧;OpenCode 14/30 垫底。

但你要只看成功率就选 Oh My Pi,那大概率会后悔。这家伙是最慢的,每个任务平均要 272 秒,跑完 30 个任务得等两个多小时,急脾气真扛不住。

反过来,Claude Code 是速度王,单任务只要 122 秒,而且它用的工具调用次数最少、生成的 token 也最少,说明路子比较“省”。但代价是贵,每个成功任务摊下来要 0.195 美元,是 OpenCode 的两倍多。

OpenCode 呢,成功率最低,可它是真便宜,一个成功任务只要 0.073 美元,适合预算紧张、任务量大、不赶时间的场景。

我的建议

说白了,这轮测试没有“全能冠军”,全是取舍:要稳就 Oh My Pi,要快就 Claude Code,要省钱就 OpenCode,Codex 属于各方面都不差的中庸之选。

我个人觉得,日常写代码查问题,速度比那 1 个任务的差距重要得多,Claude Code 这个 122 秒的响应速度用起来确实爽。但要是跑批量自动化任务,过夜跑那种,OpenCode 的成本优势就体现出来了。

当然,测试只是参考,框架版本更新快,模型也在迭代,过两个月可能又是另一番光景。你有空也可以拿自己的项目跑一遍,数据这东西,自己测过才信得过。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️