中文

R2Q:通过残差细化量化实现面向 2 位大型语言模型的鲁棒性

计算与语言 2025-12-01 v1 人工智能

摘要

大型语言模型(LLM)的快速发展带来了巨大的计算和内存需求,推动了低位量化的 adoption。虽然 8 位和 4 位格式已广泛采用,但将量化扩展到 2 位仍面临严重精度下降的挑战。为此,我们提出残差细化量化(Residual Refinement Quantization, R2Q)——一种新型 2 位量化框架,将其分解为两个顺序的 1 位子量化,形成一种自适应量化晶格。在 Llama、OPT 和 Qwen 等模型上进行的大规模评估覆盖问答、常识推理和语言建模等多种基准,表明 R2Q 在细粒度和粗粒度设置下均一致优于现有 2 位量化方法。通过残差学习机制细化量化,R2Q 提升了性能,改进了训练稳定性,并加速了在极端压缩下的收敛。此外,其模块化设计使其能够无缝集成到现有的量化感知训练(QAT)框架中。

关键词

引用

@article{arxiv.2511.21736,
  title  = {R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization},
  author = {Jiayi Chen and Jieqi Shi and Jing Huo and Chen Wu},
  journal= {arXiv preprint arXiv:2511.21736},
  year   = {2025}
}