
字节又放大招了
早上刷到一条消息:字节跳动发布了 SeedRealtime 音视频全双工大模型,而且已经上线豆包了。说实话,第一反应是盯着"全双工"这三个字看了半天——这词以前只在通信行业里见到,现在被搬到了大模型身上。
什么叫"全双工"?
简单说,以前跟 AI 语音助手聊天,都是"你说一句、它答一句",跟对讲机似的,说完还得等它反应。全双工就是打电话那种感觉——你说话的时候它已经在听了,甚至能插话、能打断,边看、边听、边说同时进行。SeedRealtime 还把视觉加了进来,你举着手机给它看个东西,它能一边看画面、一边听你说话、一边给出回应。这哪还是"语音助手",更像一个真坐在你对面的活人。
技术上难在哪?
说几个外行也能听懂的点。第一是延迟:人聊天时觉得"自然"的反应间隔大概在 200 到 300 毫秒以内,模型得在这个时间内跑完"听-想-说"整条链路,工程上非常苛刻。第二是打断检测:你正说着话它突然想插一句,它得知道什么时候该闭嘴、什么时候该接话,这比单纯识别文字难多了。第三是音视频同步:画面和声音要在同一条时间轴上理解,眼睛看到的跟耳朵听到的矛盾了怎么办,全是抠细节的活。字节这次直接把多模态做成模型原生能力,而不是把 ASR、LLM、TTS 几个模块简单拼在一起,路子是对的。
能用来干嘛?
最直接的场景就是豆包里的实时对话,你边说它边改,像跟真人唠嗑。再往外想:实时翻译、AI 陪练口语、直播互动、远程会议纪要,甚至以后的智能眼镜、机器人,都需要这种"边看边听边说"的能力。有个做外贸的朋友跟我吐槽过,跟老外开视频会最怕的就是翻译延迟,一句话等三秒,气氛全尬住。这种场景要是能跑全双工实时翻译,体验完全是两个世界。
另外多说一句,这类模型对端侧的要求也高。云上跑得再溜,网络一抖延迟就露馅。所以各家都在卷小参数版本和推理优化,谁先把时延压到 200 毫秒以内还保持质量,谁就能抢到智能眼镜、耳机这类新硬件的入场券。
我的看法是,这波"实时多模态"的竞赛才刚开局。谷歌、OpenAI 都在往这个方向使劲,字节这次算是把节奏带起来了。什么时候能下放到端侧,那才是真正有意思的时候。
评论 (0)
暂无评论,来写第一条吧 ✍️