中文

理解低精度后训练量化 LLM 的难度

机器学习 2025-04-21 v2

摘要

高参数数量的大型语言模型计算开销巨大,但可以通过将其权重压缩到非常低的数值精度来大幅提高效率。这可以通过最小化局部、层级量化误差的后训练量化,或通过最小化全局损失函数的量化感知微调来实现。本文发现,在相同的数据约束下,前者的方法几乎总是后者的表现更差,尤其在数值精度非常低时,这一现象尤为突出。我们进一步表明,这种后训练量化的困难性源于局部和全局目标函数优化之间的显著错位。我们的发现解释了为何在局部量化误差最小化中效用有限,以及在大模型非常低精度下直接进行量化感知微调的重要性。

关键词

引用

@article{arxiv.2410.14570,
  title  = {Understanding the Difficulty of Low-Precision Post-Training Quantization for LLMs},
  author = {Zifei Xu and Sayeh Sharify and Wanzin Yazar and Tristan Webb and Xin Wang},
  journal= {arXiv preprint arXiv:2410.14570},
  year   = {2025}
}