一个越来越现实的问题是:如果大模型迟早要跑进手机、PC、车机和各种终端设备里,谁来为它们不断膨胀的内存需求买单?
过去几年,AI 行业习惯了一个简单逻辑:模型越大,能力越强;参数越多,资源越贵。一个 8B 参数的大模型,通常需要约 16GB 显存才能较为从容地运行。对于云端服务器来说,这已经是成本问题;对于手机这样的端侧设备来说,则几乎是物理边界问题。
现在,一个看似反直觉的方向正在变得重要:不是继续堆参数和显存,而是重新定义模型权重本身的表示方式。
三值量化,正是这场变化的核心。
它试图回答一个过去没被真正说清楚的问题:大模型权重里,到底有多少精度是必要的,又有多少只是昂贵的冗余?
内存瓶颈,正在改写大模型竞争
传统大模型通常使用较高精度的数值存储权重。每个权重可以取大量不同数值,表达能力强,但代价也明显:显存占用高、部署门槛高、推理成本高。
三值量化则几乎站在相反方向。
它把权重可选值从几万种压缩到三种。技术上,这被称为 1.58-bit,因为表示三个值大约需要 1.58 个二进制位。换句话说,如果传统模型权重像一张全彩照片,三值量化更像把它压成只剩黑、白、灰三色的极简图。
直觉上,这种压缩应该会带来明显损失。但过去两年的研究给出了另一个答案:大模型权重中存在大量冗余。只要训练和分配方法得当,三个值也可以承载模型的大部分能力。
这也是为什么低比特训练不再只是工程优化,而逐渐变成一条全球技术路线。
2024 年,微软研究院发布 BitNet b1.58,系统论证三值大模型可以逼近全精度模型性能。随后,微软又推出 BitNet b1.58 2B4T,一个 20 亿参数、4 万亿 token 训练的开源三值模型。上个月,美国公司 PrismML 发布 Ternary Bonsai 系列,宣称是首批商业可用的 1.58-bit 模型。
学术界也在推进。Tequila 试图解决三值量化中的“死权重陷阱”,TernaryLM 则探索从零开始的原生三值训练。
一条赛道正在形成。但它此前主要发生在 NVIDIA GPU 的生态内。真正留给国产算力的问题是:这种极低比特的大模型训练,能不能在国产芯片上端到端跑通?
BitCPM-CANN 的意义,不只是模型更小
在华为鲲鹏昇腾开发者大会 KADC 2026 上,面壁智能给出了一个阶段性答案。
BitCPM-CANN 是面壁智能联合清华大学、OpenBMB 开源社区发布的三值大模型系列。它的价值并不只是“又发布了一个低比特模型”,而是把三值训练这件事,第一次完整放进国产算力体系里验证。
这件事至少有三层意义。
第一,它在华为昇腾上完成了端到端三值大模型训练。此前公开的三值模型训练,基本都在 NVIDIA GPU 上完成。国产芯片阵营过去更多是在追赶低比特推理或小规模验证,而这一次,训练链路本身被跑通了。
第二,它一次性把规模推到 8B。BitCPM-CANN 发布了 0.5B、1B、3B、8B 四个档位,覆盖从手机到 PC 的不同端侧场景。对于低比特模型来说,规模不是简单的数字扩张,而是训练稳定性、工具链适配、算子支持和评测体系共同成熟的结果。
第三,它给出了与全精度模型的完整对照评测。根据原文披露,BitCPM-CANN 在 11 项任务、四大类评测中进行了比较,覆盖常识、阅读理解、学科知识、数学推理等能力维度。1B 到 8B 档位的能力保留率在 95.7% 到 97.2% 之间,其中 3B 档位最高,达到 97.2%。
这个数字的关键不在于“接近 100%”的表面冲击力,而在于它改变了低比特模型的商业含义。

如果三值模型只保留 70% 或 80% 能力,它更多是某些轻量场景下的替代品。





