中文

QuEST:1比特权重与激活下大语言模型的稳定训练

机器学习 2025-06-12 v2

摘要

降低大语言模型(LLMs)高昂成本的一种方法是在训练或部署中使用量化或稀疏表示。虽然后训练压缩方法非常流行,但通过直接在此类表示上进行训练(即量化感知训练,QAT)来获得更精确的压缩模型这一问题仍未解决:例如,最近的一项研究(arXiv:2411.04330)指出,在使用QAT训练模型时,保持与标准FP16/BF16精度相当的准确性的“最优”比特宽度为8比特权重与激活。我们通过一种名为QuEST的新方法推进了这一前沿水平,证明了其在4比特下的最优性,以及在低至1比特权重与激活下的稳定收敛。QuEST通过改进QAT方法的两个关键方面来实现这一点:(1)通过Hadamard归一化和MSE最优拟合,对权重和激活的(连续)分布进行精确且快速的量化;(2)一种新的信任梯度估计器,其思想是显式最小化在量化状态下计算的含噪梯度与“真实”(但未知)的全精度梯度之间的误差。在Llama类型架构上的实验表明,QuEST在整个硬件支持的精度范围内都能诱导出稳定的缩放定律,并且可以扩展到稀疏表示。我们提供了GPU内核支持,表明由QuEST生成的模型可以高效执行。我们的代码可在https://github.com/IST-DASLab/QuEST获取。

关键词

引用

@article{arxiv.2502.05003,
  title  = {QuEST: Stable Training of LLMs with 1-Bit Weights and Activations},
  author = {Andrei Panferov and Jiale Chen and Soroush Tabesh and Roberto L. Castro and Mahdi Nikdan and Dan Alistarh},
  journal= {arXiv preprint arXiv:2502.05003},
  year   = {2025}
}