一阶误差至关重要:量化大型语言模型的精确补偿
机器学习
2025-11-17 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
后训练量化 (PTQ) 提供了一种高效的方法来压缩大型语言模型 (LLM),显著降低了内存访问和计算成本。现有的基于补偿的权重校准方法通常依赖于二阶泰勒展开来建模量化误差,假设在经过充分训练的全精度模型中,一阶项可以忽略不计。然而,我们揭示了在渐进式补偿过程中,潜在权重与其全精度对应值之间的第一阶偏差会逐渐积累,这一假设本质上是不成立的。为此,我们提出了FOEM——一种新型PTQ方法,显式地纳入一阶梯度项以改进量化误差补偿。FOEM通过对预量化权重进行一次一阶泰勒展开来近似计算梯度。这一方法基于潜在权重与全精度权重差异以及 Hessian矩阵。将其代入理论解后,可消除对显式计算Hessian的需求,从而避免基于反向传播的梯度方法的高计算成本和有限的普适性。该设计仅引入最小的额外计算开销。广泛的实验表明,FOEM在各种模型和基准测试中均一致优于经典的GPTQ方法。在3位权重-only量化情况下,FOEM将Llama3-8B的困惑度降低17.3%,将5-shot MMLU准确率从GPTQ实现的53.8%提升至56.1%。此外,FOEM可以与诸如SpinQuant等先进技术无缝结合,在挑战性的W4A4KV4设置下进一步获得额外收益,进一步缩小与全精度基线的性能差距,超越现有最先进的方法。
引用
@article{arxiv.2507.11017,
title = {First-Order Error Matters: Accurate Compensation for Quantized Large Language Models},
author = {Xingyu Zheng and Haotong Qin and Yuye Li and Haoran Chu and Jiakai Wang and Jinyang Guo and Michele Magno and Xianglong Liu},
journal= {arXiv preprint arXiv:2507.11017},
year = {2025}
}
备注
Accepted by AAAI 2026. The code is available at https://github.com/Xingyu-Zheng/FOEM