机器人界来了个「狠角色」:看100万小时人类视频,学会拧瓶盖
机器人到底怎么学干活?过去主流的办法是让人戴着设备遥控操作,一点点「喂」数据给机器人。这法子靠谱,但实在太慢了,一个动作录半天,成本高得吓人。最近具身智能公司 Dyna Robotics 放了个大招,直接换了一条路:让机器人看人类第一人称视频学动作。他们最新发布的机器人基础模型 DYNA-2,就是靠超过 100 万小时的人类视频训练出来的,任务成功率号称能到 90%。
100 万小时是什么概念?换算一下,相当于 170 年的人类经验。也就是说,这个模型等于「看」了人类将近两个世纪里怎么开门、怎么拿杯子、怎么拧瓶盖,然后自己琢磨动作背后的物理规律。
不靠遥控,靠「看片」学动作
DYNA-2 官方给自己定位叫「世界动作模型」。什么意思?就是它不光认识物体是什么,还知道动作会怎么改变物理世界。公司联合创始人 Jason Ma 说得挺直白:通用机器人长期卡在数据瓶颈上,人工采集物理遥操作数据根本没办法扩展到通用智能,而看人类视频就不一样了,量大、便宜、啥场景都有。
传统视觉语言模型最大的毛病是缺空间推理和接触物理的能力——它知道桌上有个瓶子,但不知道手伸过去该用多大劲、瓶子被碰一下会怎么滚。DYNA-2 的训练目标有两个:一是预测下一帧视频画面长啥样,二是预测自己该采取啥动作。这两件事一起练,空间关系、运动方式、物体受力后的反应,就都学进去了。
数据越多,干活越稳
Dyna Robotics 公布的结果里有个很提气的发现:预训练阶段加入的人类视频数据越多,机器人在 15 项基准任务里的表现就越好。他们管这叫「人到机器人的缩放规律」,意思是性能会跟着训练数据规模走,而且增长还挺可预测——这跟大语言模型那套「大力出奇迹」的路数如出一辙。
有个实验特别直观:只用了 13 分钟机器人专用数据,两只五指的机器人手就学会了拧开瓶盖。制造任务那边更夸张,后训练数据不变的情况下,光靠扩大预训练规模,成功率就从 20% 出头一路涨到 80% 到 90%。
落地表现:从 46% 到 87%
实验室数据好看,客户现场行不行?Dyna Robotics 说,DYNA-2 在一次客户部署里拿下了 87% 的质量通过率,上一代 Dyna-1 只有 46%,几乎翻了一倍。在需要根据用户指令灵活执行不同动作的任务里,视频协同训练让得分直接提升了 133%。
这几个数字放一起,方向感挺明确:机器人正在从「遥控傀儡」走向「看人类干活就会干」。虽然离科幻片里啥都会干的家政机器人还有距离,但「看视频学动作」这条路,大概率是这两年具身智能最值得盯的进展之一。
评论 (0)
暂无评论,来写第一条吧 ✍️