中文

Tequila: 用于大型语言模型的无陷阱三值量化

机器学习 2025-10-20 v2 人工智能

摘要

量化技术对于在边缘设备上部署大型语言模型(LLMs)至关重要。然而,现有的方法通常依赖缺乏高效硬件支持的混合精度乘法,使其不可行。三值权重量化通过将权重量化到{-1, 0, 1}来解决此问题,用硬件高效的加法替代昂贵的乘法。然而,这种激进的压缩导致显著的精度下降,即使在经过大量数据的昂贵量化感知训练之后也是如此。我们识别出核心问题为死区陷阱:大量权重被困在死区边界。这是因为这些权重仅接收到噪声大、信息量少的梯度,阻止其稳定逃离死区,从而严重阻碍模型容量和优化。为了解决这一问题,我们提出了Tequila,一种无陷阱量化优化方法,通过将死区被困的权重重新用作动态偏置来重新激活它们。这使得被重新利用的权重在前向传播中提供连续信号,并且在反向传播期间关键的是能够接收直接、有意义的梯度信号,从而在几乎零推理开销的情况下增强模型容量和优化。广泛的评估表明,Tequila在五个基准上优于最先进的三值量化方法。具体而言,在ARC基准上,它实现了超过4%的准确率提升,接近全精度性能(差距在1%以内),同时推理速度提升3.0倍。因此,Tequila为在资源受限环境中部署先进LLM提供了一种高度实用和高效的实现。代码位于 https://github.com/Tencent/AngelSlim。

关键词

引用

@article{arxiv.2509.23809,
  title  = {Tequila: Trapping-free Ternary Quantization for Large Language Models},
  author = {Hong Huang and Decheng Wu and Rui Cen and Guanghua Yu and Zonghang Li and Kai Liu and Jianchen Zhu and Peng Chen and Xue Liu and Dapeng Wu},
  journal= {arXiv preprint arXiv:2509.23809},
  year   = {2025}
}