中文

WinQ:绕过鞍点加速语言模型量化感知训练

机器学习 2026-05-20 v1 数值分析 数值分析 最优化与控制

摘要

量化感知训练 (QAT) 被广泛用于通过使用来自量化模型的梯度来训练全精度权重,以实现语言模型的量化化。主要瓶颈是其收敛速度慢且容易出现早期性能平台期,尤其是在低于 4 位宽度时更为明显。虽然此问题在先前工作中已被观察到,但其确切原因仍不清楚。本文通过估计损失函数 Hessian 矩阵的谱来分析 QAT 的收敛性。我们发现,权重会收敛到 saddle 点附近的平坦区域,其中大部分 Hessian 特征值的正负都很大。训练过程中,Hessian 特征值中相当比例的特征值集中在接近零,幅度减小。在更低的位宽下,Hessian 谱中特征值的幅度会显著减小。为缓解这些问题,我们提出了一种称为 WinQ 的算法,用于加速 QAT,其包括:(1)定期将权重重置为全精度权重与量化权重的线性插值,减少到量化网格的距离并增加特征值的幅度;(2)计算噪声注入权重的梯度以对 Hessian 进行正则化。大量实验表明,WinQ 在各种量化方法和模型上将 QAT 加速最高可达 4 倍。在相同的训练成本下,WinQ 将最新进展的亚 4 位量化提升最高可达 8.8%。这些结果在 16 种不同的语言模型、量化方法和位宽设置下均保持一致。

关键词

引用

@article{arxiv.2605.17471,
  title  = {WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points},
  author = {Dongyue Li and Zechun Liu and Kai Yi and Zhenshuo Zhang and Changsheng Zhao and Raghuraman Krishnamoorthi and Harshit Khaitan and Hongyang R. Zhang and Steven Li},
  journal= {arXiv preprint arXiv:2605.17471},
  year   = {2026}
}

备注

23 pages; To appear in ICML 2026