一年开播场次翻 11 倍、GTV 涨 82%:美团智播怎么把数字人直播做得“不像假人”
技术笔记 1 次阅读

一年开播场次翻 11 倍、GTV 涨 82%:美团智播怎么把数字人直播做得“不像假人”

美团智播数字人直播技术

先别急着说"假",看看这组数据

去年这时候,你要跟我说数字人直播能撑起本地生活的生意,我是不太信的。直播间里那张脸,看两分钟就腻了,动作来回就那几个,说句话手势跟嘴还对不上——这种"一眼假"的东西,凭什么让用户下单?

直到我翻到美团技术团队前几天发的实践总结,才觉得自己打脸了。美团智播这个面向本地生活的 AI 数字人直播方案,过去一年的成绩单是:月日均 GTV 同比增长 82.12%,月日均观看人次涨了 163.44%,开播场次直接翻了 11 倍。今年 7 月它在中国互联网大会上亮相,不少现场观众的第一反应是"完全看不出是数字人"。

从"一眼假"到"认不出",中间隔着的可不是一句"AI 进步了"。我把那篇技术拆解读了两遍,挑几个硬核的说说。

商家其实是被逼上直播这条路的

先说清楚美团为什么要做这件事。本地生活里躺着几百万商家,直播早就是标配,可真人直播对中小商家太不友好了:一个像样的数字人形象定制,报价动辄几万;养 7×24 小时的主播团队,成本更扛不住。最要命的是时效——晚上 8 点突然要搞限时秒杀,你让真人主播凌晨爬起来开播?不现实。

所以需求很直白:形象要真、随时能开播、成本还得压下来。但真做起来,四个坎儿横在那儿:形象高保真、动作自然多样、手势跟语义对得上、万路并发时 GPU 成本别爆炸。

长得真:把"身份"和"姿态"拆开学

数字人最容易翻车的就是换装。很多方案你给它换件衣服,它连脸都一起"换"了——品牌要的就是那张脸,商家能不急吗。美团的做法叫结构解耦,把姿态、身份、背景三个维度拆开处理,身份特征用残差方式注入,不让姿态信息"污染"它。这套思路加上自奖励编辑(SREdit),已经发在 ACM MM 2026 上,公开数据集上编辑精度提升 2.5% 到 3.8%。SREdit 还有个巧思:编辑和评判共用同一个模型,两边共享视觉理解,模型想骗评判器都没门。

动作和手势:连"指商品"这种细节都要较真

动作生成这块,美团提了个叫 MoTiGA 的方法,被 CVPR 2026 收了。核心是把大语言模型那套自回归生成搬到人体动作上,重建误差直接降了 72%。他们还在 HumanML3D 上攒了 10 万多组人类偏好数据做训练——说白了,让模型照着真人觉得"自然"的样子去动,而不是照着数学指标去动。

更绝的是手势。真人主播说"这款披萨料特别足"会张开手比划,说"看右边链接"会抬手去指——这种跟语义绑定的协调手势,以前真没人做出来过。美团的 StreamingTalk 把生成改成流式的,数字人边说边动,延迟跟说话时长无关:介绍产品时双手展示、讲优惠时兴奋挥手、被提问时托腮思考,一条流里顺滑切换。这活儿以前是"演",现在是"活"。

卖得好:万路并发才是真本事

单路做得好不算本事,几万家店同时开播才见真章。传统做法里,每路直播都要吃一大堆视觉 token,万路并发时推理成本能把产品压死。美团的 Glance2Gaze 从人类视觉的"扫视-注视"机制找灵感,把视觉 token 从 576 个压到 144 个,压缩率 75%,性能损失控制在 2% 以内,推理提速 2.5 倍,单路成本降了 60% 以上——这项发在 NeurIPS 2025,还兼容 FlashAttention-2,不用改现有基础设施就能上。系统层面则是"双引擎":实时交互引擎管观众提问,全双工流式响应;内容量产引擎让创意、检索、思考、生成、评测五个智能体像流水线一样产视频,一条商品讲解从原来人工的数小时压到分钟级。

说点我的看法

老实说,数字人直播这个赛道前几年被玩坏了,一堆公司靠"AI 主播替你躺赚"的话术割韭菜,把行业口碑都带崩了。但美团这份总结给我的感觉是:它没在吹"替代真人",而是老老实实解决"商家开不起播"的问题。形象、动作、手势、成本,每个坎儿都有对应的论文和技术方案撑着,而不是一张 PPT。

当然,数字人再真也是数字人,情感共鸣、临场应变这些它短期内还补不上课。但要是只为了把货卖出去,这套东西确实够用了。至于会不会抢了真人主播的饭碗——短期内不会,它抢的是"开不起播"的那部分市场。你说呢?

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️