首页>研读
何建秋
何建秋 原创2026-6-2 12:03 · 126 阅读

三值大模型,端侧AI的内存战争

一个越来越现实的问题是:如果大模型迟早要跑进手机、PC、车机和各种终端设备里,谁来为它们不断膨胀的内存需求买单?

过去几年,AI 行业习惯了一个简单逻辑:模型越大,能力越强;参数越多,资源越贵。一个 8B 参数的大模型,通常需要约 16GB 显存才能较为从容地运行。对于云端服务器来说,这已经是成本问题;对于手机这样的端侧设备来说,则几乎是物理边界问题。

现在,一个看似反直觉的方向正在变得重要:不是继续堆参数和显存,而是重新定义模型权重本身的表示方式。

三值量化,正是这场变化的核心。

它试图回答一个过去没被真正说清楚的问题:大模型权重里,到底有多少精度是必要的,又有多少只是昂贵的冗余?

内存瓶颈,正在改写大模型竞争

传统大模型通常使用较高精度的数值存储权重。每个权重可以取大量不同数值,表达能力强,但代价也明显:显存占用高、部署门槛高、推理成本高。

三值量化则几乎站在相反方向。

它把权重可选值从几万种压缩到三种。技术上,这被称为 1.58-bit,因为表示三个值大约需要 1.58 个二进制位。换句话说,如果传统模型权重像一张全彩照片,三值量化更像把它压成只剩黑、白、灰三色的极简图。

直觉上,这种压缩应该会带来明显损失。但过去两年的研究给出了另一个答案:大模型权重中存在大量冗余。只要训练和分配方法得当,三个值也可以承载模型的大部分能力。

这也是为什么低比特训练不再只是工程优化,而逐渐变成一条全球技术路线。

2024 年,微软研究院发布 BitNet b1.58,系统论证三值大模型可以逼近全精度模型性能。随后,微软又推出 BitNet b1.58 2B4T,一个 20 亿参数、4 万亿 token 训练的开源三值模型。上个月,美国公司 PrismML 发布 Ternary Bonsai 系列,宣称是首批商业可用的 1.58-bit 模型。

学术界也在推进。Tequila 试图解决三值量化中的“死权重陷阱”,TernaryLM 则探索从零开始的原生三值训练。

一条赛道正在形成。但它此前主要发生在 NVIDIA GPU 的生态内。真正留给国产算力的问题是:这种极低比特的大模型训练,能不能在国产芯片上端到端跑通?

BitCPM-CANN 的意义,不只是模型更小

在华为鲲鹏昇腾开发者大会 KADC 2026 上,面壁智能给出了一个阶段性答案。

BitCPM-CANN 是面壁智能联合清华大学、OpenBMB 开源社区发布的三值大模型系列。它的价值并不只是“又发布了一个低比特模型”,而是把三值训练这件事,第一次完整放进国产算力体系里验证。

这件事至少有三层意义。

第一,它在华为昇腾上完成了端到端三值大模型训练。此前公开的三值模型训练,基本都在 NVIDIA GPU 上完成。国产芯片阵营过去更多是在追赶低比特推理或小规模验证,而这一次,训练链路本身被跑通了。

第二,它一次性把规模推到 8B。BitCPM-CANN 发布了 0.5B、1B、3B、8B 四个档位,覆盖从手机到 PC 的不同端侧场景。对于低比特模型来说,规模不是简单的数字扩张,而是训练稳定性、工具链适配、算子支持和评测体系共同成熟的结果。

第三,它给出了与全精度模型的完整对照评测。根据原文披露,BitCPM-CANN 在 11 项任务、四大类评测中进行了比较,覆盖常识、阅读理解、学科知识、数学推理等能力维度。1B 到 8B 档位的能力保留率在 95.7% 到 97.2% 之间,其中 3B 档位最高,达到 97.2%。

这个数字的关键不在于“接近 100%”的表面冲击力,而在于它改变了低比特模型的商业含义。

图片来源:BitCPM-CANN完成国产算力训练。

如果三值模型只保留 70% 或 80% 能力,它更多是某些轻量场景下的替代品。

付费阅读
剩余 70% 内容需要支付 19.90 元 后可完整阅读
感谢您支持付费阅读,开通VIP会员尊享免费查阅特权!
致力于发现互联网资讯,以信息普及传播价值为目的,每日分享热点行业报告、数据图表、精选研读深度报告,致力成为专业的行业研究报告与数据分享平台!
QR1

QR2

微信客服:BGP400 商务合作:hz@baogaopai.com 举报邮箱:sc@baogaopai.com 在线时间:工作日09:00-12:00 13:30-18:00
Copyright © 2019 - 2026 报告派 - 深度研读 精准解析 BAOGAOPAI.COM
粤ICP备20034722号粤公网安备44050702001367号