中文

SignRoundV2:针对 LLMs 极端低位后训练量化的性能差距

计算与语言 2026-05-19 v2 人工智能

摘要

极端低位量化对于高效部署大型语言模型(LLM)至关重要,但在2位甚至4位(例如 MXFP4)时常导致严重的性能下降。我们提出了SignRoundV2,一个旨在在激进压缩下保持高性能的后训练量化框架。SignRoundV2引入了(1)一种简单且高效的自适应混合精度策略,利用梯度信息和量化引起的重构误差来指导层级位分配,以及(2)一组轻量级稳定技术,包括损失过滤和预调优比例搜索,以提高在极端低位 regime 中的调优效果。我们的做法是在量化模型与全精度模型之间缩小性能差距的重要一步。跨多种 LLM 的实验结果表明,SignRoundV2 在混合 MXFP 设置下实现近乎无损的性能,将平均4.5位的差距缩小至约1%,同时在具有挑战性的2位权重-only 量化中显著提升准确率。源码可在 \url{https://github.com/intel/auto-round} 获取。

关键词

引用

@article{arxiv.2512.04746,
  title  = {SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs},
  author = {Wenhua Cheng and Weiwei Zhang and Heng Guo and Haihao Shen and Zaner Ma},
  journal= {arXiv preprint arXiv:2512.04746},
  year   = {2026}
}