DeepSeek 悄悄更新 Harness:多模态测试来了,V4 视觉版还远吗?
技术笔记 2 次阅读

DeepSeek 悄悄更新 Harness:多模态测试来了,V4 视觉版还远吗?

今早刷到一条消息:DeepSeek 开源的评测框架 Harness 更新了,这次加上了多模态支持。圈里人一看就懂,这是在给后面的大招铺路——社区里不少开发者都在猜,V4 的视觉版本是不是快来了。

Harness 到底是干嘛的

简单说,Harness 是 DeepSeek 用来给自家模型"考试"的框架。模型训练完到底行不行,不能光靠聊天手感,得跑一堆标准评测任务,比如代码生成、数学推理、逻辑问答,用统一的流程去测、去对比。以前这套东西主要处理纯文本任务,模型输入一段话,输出一段话,评分相对好设计。

但多模态就不一样了。图像理解、图表分析、OCR 识别、甚至让模型看着屏幕截图去操作界面,这些场景的"标准答案"很难用一段文本描述清楚。评测框架得模拟真实的使用环境:给模型一张 UI 截图,看它能不能找到按钮;给一张财报图表,看它能不能读出关键数字。

多模态评测难在哪

我自己的感受是,文本评测顶多算"闭卷考",多模态评测直接变成"开卷考加实操"。你得准备图片、视频、音频各种格式的样本,还得定义清楚什么叫答对了。比如一张模糊的截图,人眼都费劲,模型答错了算它的还是算题目的?这些细节都要框架层去兜底。

所以 Harness 这次补上多模态支持,等于把"考试系统"先建好了。测试框架到位了,后面模型的视觉能力上线就有了验收标准,发布节奏自然能快起来。

对普通开发者意味着什么

如果你正打算基于 DeepSeek 做多模态应用,比如图片问答、文档解析、自动化测试工具,现在就可以先用 Harness 把模型能力摸个底,再决定方案怎么设计。评测先行,比上线了再翻车强。

说句题外话,DeepSeek 这半年更新节奏明显加快了,从长上下文到 Agent 能力,再到这次的多模态铺垫,每一步都踩在点上。V4 视觉版什么时候来不好说,但方向已经很清楚了。想尝鲜的,建议先把 Harness 拉下来跑一跑,等模型发布那天你已经是老司机了。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️