
DeepMind又搞事情:一个视频生成模型,凭啥能干翻所有视觉专用模型?
老实说,看到这条新闻的时候我愣了一下。
谷歌 DeepMind 前几天发了个叫 GenCeption 的东西,乍看名字挺玄乎的,但仔细一看它的做法——把一个视频生成模型反过来用,让它去干深度估计、图像分割、3D姿态估计这些活儿,而且干得还不赖。
这就有点意思了。

一个模型打天下,这事儿以前没人敢想
做过计算机视觉的同学应该都懂,这行最大的痛点就是——每个任务都得搞一个专用的模型。
想做图像分割?得上 Segment Anything。想做深度估计?得上 Depth Anything。想做姿态估计?得再搞一个专门的模型。每个模型结构都不一样,训练数据不一样,推理方式也不一样。每次换个任务,基本等于从头再来。
但 GenCeption 等于直接掀桌子了:我一个视频生成模型,凭什么不能干这些?
它的思路其实挺简单的——你视频生成模型不是会"理解"画面里的空间关系和时间变化吗?那我把这个理解能力反向提取出来,不就能做各种视觉任务了?
DeepMind 团队还真就试了。他们拿阿里开源的 通义万相 Wan2.1 作为基座模型,在上面做了一层改造,让模型不仅能"生成"画面,还能"理解"画面。

数据量小得离谱,效果却出奇的好
这事的另一个亮点是训练数据。
GenCeption 的训练集只有7500段视频,里面就 800 个数字人体模型,配合 200 段动作捕捉序列,用 Blender 在不同背景和镜头角度下渲染出来的。
换句话说,它几乎没看过真实世界的数据。
但神奇的是,训练完之后,它不仅能正确处理真实世界多人视频场景,还能迁移到猫猫狗狗和机器人身上去。论文里特别提到,它甚至能保留猫胡须和单根发丝这样的边缘细节——这个精细度,说实话比 Blender 渲染的原始素材还要好。
什么概念?就是模型自己"脑补"出了比训练数据更精细的细节。这不就是传说中的举一反三么。

一大一小两个版本,跑起来还挺快
GenCeption 出了两个版本:
小模型处理 81 帧视频大概需要 6 秒;
大模型有 140 亿参数,同样长度的视频跑一圈大概 10 秒。
这个速度对于实际应用来说,已经挺能打了。要知道传统方法做深度估计+分割+姿态估计,一套组合拳下来,时间起码翻倍。
而且 GenCeption 还有一个很酷的特点:一次前向传播就能出结果。不像传统扩散模型需要多步去噪,它一步到位。这就好比以前跑马拉松要分好几段跑,现在直接一口气冲线了。

这说明什么?
我觉得 GenCeption 最大的意义不是它有多强,而是它展示了一个方向:生成式模型的理解能力,可能被我们严重低估了。
这两年大家都在追着做视频生成,从 Sora 到各种国产模型层出不穷,大家的注意力都放在"生成的效果好不好看"上。但 DeepMind 提醒了我们——这些模型在训练过程中,其实已经学会了对世界的深刻理解,只是我们一直没去挖掘这个能力。
这就好比一个人天天写小说,你以为他只会写故事,但其实他对人物心理、社会关系、语言逻辑的理解,可能远超你的想象。
GenCeption 目前代码是开源的,论文也挂在 arXiv 上了。感兴趣的同学可以去翻一翻,说不定能给你自己的项目带来一些新思路。
至少对我来说,这周最值得关注的技术新闻,就是它了。
评论 (0)
暂无评论,来写第一条吧 ✍️