中文

Sherry:基于细粒度稀疏化的硬件高效 1.25 位三值量化

机器学习 2026-01-14 v1 人工智能

摘要

大型语言模型(LLM)在资源受限的边缘设备上的部署正受到昂贵的内存和计算需求的制约。虽然三值量化通过将权重减少到 {-1, 0, +1} 来提供了具有竞争力的解决方案,但当前实现方式与通用硬件存在根本性偏差。大多数现有方法必须在 2 位对齐打包(导致显著的位浪费)或 1.67 位不规则打包(降低推理速度)之间做出选择。为解决这一矛盾,我们提出了 Sherry,一种硬件高效的三值量化框架。Sherry 引入 3:4 的细粒度稀疏化,通过将四个权重打包为五个比特来实现正则化的 1.25 位宽度,恢复了二进制对齐。此外,我们识别出稀疏三值训练中的权重捕获问题,这会导致表征性崩溃。为解决此问题,Sherry 引入了 Arenas,一种退火残差突触机制,以保持训练期间的表征多样性。在 LLaMA-3.2 上进行的经验评估表明,Sherry 在五个基准测试中匹配了最先进的三值性能,同时显著减小了模型大小。值得注意的是,在 Intel i7-14700HX CPU 上,我们的 1B 模型相对于 SOTA 基线实现了零精度损失,同时提供了 25% 的位节省和 10% 的速度提升。代码可在 https://github.com/Tencent/AngelSlim 获取。

关键词

引用

@article{arxiv.2601.07892,
  title  = {Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification},
  author = {Hong Huang and Decheng Wu and Qiangqiang Hu and Guanghua Yu and Jinhai Yang and Jianchen Zhu and Xue Liu and Dapeng Wu},
  journal= {arXiv preprint arXiv:2601.07892},
  year   = {2026}
}