端侧AI模型跑出127 tokens/s,三值权重到底是什么黑科技
技术笔记 1 次阅读

端侧AI模型跑出127 tokens/s,三值权重到底是什么黑科技

端侧AI模型跑出127 tokens/s,三值权重到底是什么黑科技

昨天刷到一条消息,DeepGrove 这个独立 AI 实验室搞了个叫 Maple-Preview 的模型,直接在 iPhone 上跑出了 127 tokens/s。什么概念?之前号称端侧很强的 Bonsai 27B,在手机上只有 9.6 tokens/s,这一下快了十三倍。说实话我第一反应是不太信,现在的端侧模型不都是靠量化硬撑吗?

三值权重,听着玄乎,原理其实挺直白

咱们平时用的模型,权重基本都是 FP16 或者 INT8 这种精度,一个参数占 2 个字节或者 1 个字节。DeepGrove 的思路更狠:直接把每个权重约束成三个值——-1、0、1。对,就三个数,一个参数理论上不到 2 个 bit 就装下了。

内存占用下来了,计算带宽需求也跟着降,这对手机这种内存带宽有限的环境简直是量身定做。代价也不是没有,权重信息量变少了,模型表达能力理论上会打折扣,所以它用了混合专家(MoE)架构来补救:总参数 202 亿,但每次推理只激活 14.9 亿,256 个专家里只唤醒 8 个,算力需求压得很低。

跑分归跑分,实际体验才见真章

官方给的演示数据挺亮眼:在 MacBook Pro(M5 Pro)上做 IMO 2024 的 P1 题,7 分拿满,速度 281.5 tokens/s。长上下文也没崩,处理 13.1 万 token 的时候内存占用才 7.69GB。这个数字放端侧模型里,确实有点东西。

不过我得泼盆冷水。预览版嘛,官方自己都说了还在 preview stage。三值权重这条路以前也不是没人试过,早年 BitNet 那一派就在推 1-bit 大模型,问题是训练难度大、收敛慢,很多项目做着做着就没了下文。DeepGrove 能不能把这条路走通,还得看后续迭代。

端侧 AI 今年明显在加速

细想一下,今年端侧 AI 的节奏是真的快。苹果在推自己的本地模型,各家芯片厂都在卷 NPU 算力,现在又来一个三值权重的选手。方向其实挺一致:把模型塞进手机,让数据不出设备,隐私和响应速度两全。

我个人的判断是,三值权重短期内不会取代量化,但它给端侧模型打开了一个新思路——与其在 4-bit、8-bit 里抠精度,不如换个玩法重新设计权重分布。对于做移动端 AI 的开发者来说,这是个值得盯着的方向,说不定明年就有基于这种思路的开源模型能直接拿来用。

总之,端侧 AI 的好戏,才刚刚开始。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️