李飞飞的World Labs又掀桌子了:几张照片,直接生成一个能走进去的3D世界
项目分享 2 次阅读

李飞飞的World Labs又掀桌子了:几张照片,直接生成一个能走进去的3D世界

World Labs Atlas

李飞飞的World Labs又搞了个大新闻

前脚各家视频模型还在为生成几秒钟的"电子榨菜"卷得头破血流,后脚李飞飞创办的World Labs直接掀了桌子——9月初,他们发布了全球首个多模态世界模型Atlas。

说"全球首个"可能有人不服,但看完成品演示,大多数人会闭嘴。以前我们玩视频生成,在对话框里卑微地敲"镜头缓慢左移、绕着人物旋转",回车之后全凭老天保佑,抽卡一样。Atlas不一样:它直接把相机位姿参数当底层输入,你给坐标、给轨迹、给速度,丢进去1到6张普通照片,就能生成最长1分钟、1440p分辨率的大片,画面空间几何还保持丝滑一致。

这家公司什么来头

简单回顾下。李飞飞,AI圈没人不知道的名字——ImageNet的缔造者,斯坦福大学终身教授,美国三院院士,江湖人称"AI教母"。2024年她离开学术舒适区下场创业,创办World Labs做空间智能。资本用脚投票:2026年2月,World Labs完成10亿美元融资,估值冲到50亿美元,是AI领域融资最猛的公司之一。

她的逻辑一直很清晰:大语言模型是"黑暗里的文字高手",能谈论现实,却没有真正生活在现实里的经验。机器看完一张图,能不能理解背后的三维空间、下一秒会发生什么?这就是World Labs死磕的赛道。

Atlas到底能干嘛

三个杀手锏,一个一个说。

第一,相机控制生成。这是最直观的炸场操作。输入一张只拍到机器人正面的照片,它能脑补出完整背影;给一张泳池边角照,它能靠"世界常识"把没拍到的草坪和远山修出来。有人拿两张八竿子打不着的照片扔进去,它甚至能强行生成走廊和大门,把两个场景无缝焊在一起。

第二,空间重建。传统3D扫描得扛着设备围着目标转几十圈,拍几百上千张照片。Atlas只需要2到25张游客视角的平拍照片,就能还原出斯坦福大学Main Quad的草坪、拱廊、教堂外墙全部细节,然后镜头拔地而起,给你来一段上帝视角航拍。在DTU、ETH3D等公开数据集上,它的稀疏视角重建误差做到了25.3,对比之下Pi3X是28.7,Depth Anything 3飙到39.3。

第三,也是最狠的——Real to Sim。现在搞机器人训练的人都知道,最大痛点是"虚拟训练场不够用"。业内有种估算,完全靠传统方式收集机器人训练数据,成本可能达到100万亿美元的量级。Atlas的路线是:拿手机拍两段24帧的工厂或房间视频,它直接吐出一个高精度的3D物理空间,机器人钻进这个孪生空间里疯狂试错,机械臂碰箱子、拉柜门、捏海绵,受力反馈都能模拟。录一段真实现场,就能衍生出千万种光照、摆放和障碍物条件。

技术底子和实战成绩

架构上Atlas用的是多模态自回归扩散Transformer——把语言模型的自回归预测、扩散模型的去噪生成、Transformer的成熟基建全揉一起了,所以能同时吃到大模型的KV Cache优化和扩散模型的采样蒸馏红利。

真人盲测里,面对MiniMax H3胜率75%,打Gemini Omni Flash胜率81%,对FLUX 3冲到93%,打Seedance 2.5更是凶残的94%。目前Atlas已经向部分合作伙伴开放Early Access,未来会成为World Labs旗下Marble平台的底层模型。

从ImageNet让机器"看见"世界,到Atlas让机器"理解"空间,李飞飞二十年就死磕这一条线。这波操作能不能撑起50亿美元的估值,时间会给出答案。但方向我是服气的:当语言智能把互联网知识喂饱了AI,下一张入场券,属于能理解真实世界的模型。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️