量化感知训练的标度定律
机器学习
2025-05-21 v1 计算与语言
摘要
大型语言模型 (LLM) 需要巨大的计算和内存资源,导致部署挑战。量化感知训练 (Quantization-Aware Training, QAT) 通过降低模型精度来解决这些挑战,同时保持性能。然而,QAT(尤其是 4 位精度 W4A4)的标度行为尚不为人所知。现有的 QAT 标度定律常忽视诸多关键因素,如训练标记数和量化粒度,限制了其适用性。本文提出了统一的 QAT 标度定律,将量化误差建模为模型规模、训练数据量和量化分组大小的函数。通过 268 项 QAT 实验,我们展示量化误差随模型规模增大而减小,但随训练标记数增多和量化粒度粗化而上升。为识别 W4A4 量化误差来源,我们将其分解为权重和激活两个组成部分。两个组成部分均遵循 W4A4 量化误差的总体趋势,但灵敏度不同。具体而言,权重量化误差随训练标记数增多而加剧上升。进一步分析表明,FC2 层激活量化误差因异常值导致,是 W4A4 QAT 量化误差的主要瓶颈。通过对该瓶颈应用混合精度量化,我们证明权重和激活量化误差可趋于相似水平。此外,随着训练数据增多,权重量化误差最终超过激活量化误差,表明在此类场景中降低权重量化误差同样重要。这些发现为改进 QAT 研究和开发提供了关键见解。
引用
@article{arxiv.2505.14302,
title = {Scaling Law for Quantization-Aware Training},
author = {Mengzhao Chen and Chaoyi Zhang and Jing Liu and Yutao Zeng and Zeyue Xue and Zhiheng Liu and Yunshui Li and Jin Ma and Jie Huang and Xun Zhou and Ping Luo},
journal= {arXiv preprint arXiv:2505.14302},
year = {2025}
}
备注
A unified scaling law for QAT that models quantization error as a function of model size, training data volume, and quantization group size