机器人看一段29秒视频就能学会新技能?这个开源框架我扒了一遍
技术笔记 1 次阅读

机器人看一段29秒视频就能学会新技能?这个开源框架我扒了一遍

前两天刷到一条消息,说自变量机器人开源了个叫 HOST 的框架,能让机器人看一段几十秒的人类视频就学会新技能。说实话,第一反应是"又来了,营销号式标题"。但点进去看了论文和代码之后,我承认,这玩意确实有点东西。

机器人看视频学技能

不模仿,先想象

以前的机器人学技能,路子基本是"模仿学习":把人的动作翻译成机器人的动作,然后照着做。听着合理,但坑特别多——人的关节和机器人的关节结构不一样,同一个动作映射过去就变味了;而且稍微换个场景,立马抓瞎。

HOST 换了个思路:不翻译你的动作,而是让机器人先"想象"做完这件事之后的结果,再倒推自己该怎么做。这个灵感来自认知科学里的"观察学习"——人学新东西其实也不是靠穷举练习,而是先在脑子里模拟一遍预期效果,然后照着执行。这么一说,是不是还挺像人脑的?

数据不会骗人

效果怎么样?官方给了一组数据:机器人看一段 29 秒的人类视频,学技能的成功率能到 62%,而零样本基线只有 45%。更夸张的是,跟 Pi-0.5 + 微调那套方案比,HOST 需要的数据量少了 50 倍,学习速度提升了 500 倍。

50 倍什么概念?以前你要给机器人录几百上千条演示数据,现在几十条甚至一条就够起步了。做过机器人的人都懂,数据采集有多痛苦——这直接砍掉了整个行业最大的成本项之一。

它到底怎么做到的

扒了下技术细节,有两个点我觉得特别聪明。

第一个是"按任务进度对齐"。你想啊,同样工作 10 秒,视频里的人可能已经切完菜开始炒菜了,机器人还在吭哧吭哧切菜。如果傻乎乎按时间轴对齐,机器人看到的永远是"落后"的画面,任务进度全丢了。HOST 的做法是,把视频每一帧和机器人操作的每一步都映射到同一个向量空间,再用动态时间规整(DTW)算法自动对齐"人的第 X 帧"和"机器人的第 Y 步"。这样一来,机器人每一步看到的,都是跟任务进度严丝合缝的那一帧。这个对齐误差直接降了一个数量级。

第二个是双专家架构。HOST 的核心是个带视觉预测功能的级联策略模型,内部是两个分工明确的大脑:视觉大脑专门处理画面、定位进度、预测未来图景;动作大脑负责把预测的图景转化成具体动作。有点像一个负责看路,一个负责踩油门。

训练也分两段:先是"同体预训练",让机器人看自己干活的视频,学会预测完成状态;再是"人机视频训练",把人类演示转成机器人视角的任务结果,再倒推动作。论文和代码现在都开源了,GitHub 上直接能扒。

说点我的看法

这个框架最让我兴奋的不是某个指标,而是它指向了一个方向:家庭机器人以后可能不用再搞那种"专业数据采集团队"了,你给它演示一遍怎么叠衣服、怎么擦桌子,它就能学。这要是真走通了,人形机器人进家庭的时间表可能比我们想的要快。

当然,62% 的成功率离"放心用"还有距离,而且现在验证的场景大概率还比较受限。但开源这件事本身就很值——全世界的实验室都能在这个基础上迭代,后面几个月这块的进展估计会很快。

反正我已经把仓库 star 了,等它更新。对机器人或者具身智能感兴趣的朋友,值得去扒一扒原文。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️