Continuous Approximations for Improving Quantization Aware Training of LLMs
机器学习
2024-10-16 v1 人工智能
计算与语言
摘要
模型压缩方法用于减少大型语言模型(LLM)的计算和能源需求。量化感知训练(Quantization Aware Training, QAT)是一种有效的模型压缩方法,旨在减少量化后性能下降。为进一步最小化此性能下降,我们在量化函数上引入了两种连续近似方法,该函数传统上通过直穿估计器(Straight-Through Estimator, STE)进行近似,以及夹取函数。通过同时应用这两种方法,量化后模型在 WikiText-v2 数据集上的 perplexity(PPL)达到 9.0815,显著优于基线方法的 9.9621。此外,我们在 BoolQ 上实现了 2.76% 的改进,在 MMLU 上实现了 5.47% 的改进,证明了通过本方法可以更准确地学习步长和权重。本方法在相同的精度、模型规模和训练设置下实现更好的性能,为开发更高效的 LLM 技术贡献了力量,这与全球可持续发展目标相吻合。
引用
@article{arxiv.2410.10849,
title = {Continuous Approximations for Improving Quantization Aware Training of LLMs},
author = {He Li and Jianhang Hong and Yuanzhuo Wu and Snehal Adbol and Zonglin Li},
journal= {arXiv preprint arXiv:2410.10849},
year = {2024}
}