
从WAIC 2026看AI模型落地:推理优化与端侧部署的那些事
这周WAIC 2026在上海办得热火朝天,去现场逛了一圈,发现今年最大的变化不是谁家模型参数更大——恰恰相反,大家都在聊怎么让AI真正跑起来、用起来。
以前聊AI,张口闭口千亿参数、万亿训练量。今年不一样了,所有人都在问同一个问题:这东西到底能不能落地?
推理优化才是真正的硬骨头
先说个让人挺吃惊的数据。工信部在新闻发布会上透露,2025年我国AI核心产业规模已经突破1.2万亿元。数字很大,但你仔细想想,这么多模型训出来之后,真正在生产环境里跑起来的有多少?
我去WAIC现场逛了一圈,发现好几个展台都在展示推理优化的方案。神雲科技那台52U高密度液冷机柜,塞了96颗MI355X,GPU密度比普通48U机柜提升了50%。说白了,大家都在想办法把单位空间里的算力堆上去,因为推理阶段对算力的需求一点不比训练少。
但堆硬件只是最粗暴的办法。真正让我觉得有意思的,是一些软件层面的优化思路。有一家创业公司展示的方案让我印象很深——他们通过模型量化和算子融合,把一个70B参数的模型推理延迟从800ms压到了120ms。怎么做到的呢?其实就是把一些重复计算合并了,把精度稍微降一降,但效果该有的都有。
端侧部署终于开始认真了
今年WAIC上还有个趋势很明显:端侧AI不再是噱头了。
阿里云展台展示了通义千问在手机上的运行效果,虽然参数缩到了7B级别,但实时语音交互的流畅度已经相当可以了。我试了一下,基本感觉不到延迟。这在两年前是完全不敢想的。
荣耀那台Robot Phone也去了现场,甚至还被带到了世界杯夺冠现场。说实话,手机搞个微型机械云台这个思路挺巧的——不是堆大模型,而是给AI一个"身体",让它能物理化地跟人交互。这套4DoF钛合金机械云台比主流方案小了70%,能塞进手机里本身就是个工程奇迹。
端侧部署最难的不是模型本身,而是怎么在电池、散热、算力三座大山之间找到平衡。从今年的展示来看,各家已经摸索出了各自的路径:有的走量化压缩路线,有的走硬件的异构计算路线,还有的干脆重写推理引擎的底层算子。
开源模型正在改变游戏规则
GLM-5.2开源之后我用本地4090跑了一下,效果超出了预期。要知道,几个月前同等水平的模型还只能在云端调用。现在开源社区已经把门槛拉到这么低了。
工信部在会上也提到要"推动国家级人工智能开源社区成长",这其实就是给开发者铺路。当开源模型的能力逼近闭源,独立开发者和中小团队也能做出不错的AI应用。这对整个技术生态来说是个良性的循环。
不过开源也有开源的烦恼。模型权重公开了,但怎么把它跑快、跑稳,那套工程化的功夫还是得自己下。我认识的一个朋友在本地搭了一套GLM-5.2做客服系统,折腾了两个月才把响应时间压到可接受的范围。后来用了vLLM做推理框架,才把吞吐量提上来。
说到底,模型是子弹,工程能力才是枪。
总结
这次WAIC给我最大的感受是:AI行业终于从"比谁家模型大"走到了"比谁家模型好用"。推理优化、端侧部署、开源生态,这些看起来不性感的"生意活",反而成了决定AI能不能真正走进生产环境的关键。
技术在进步,但能让技术落地的永远是那些默默做工程优化的人。如果你也在做模型部署和推理优化的工作,欢迎在评论区聊聊你遇到的那些坑——咱们互相救一救。
评论 (0)
暂无评论,来写第一条吧 ✍️