EfficientQAT:大型语言模型的高效量化感知训练
机器学习
2025-05-20 v3 人工智能
计算与语言
摘要
大型语言模型(LLM)是现代自然语言处理与人工智能领域的关键技术。然而,它们面临显著的内存需求挑战。虽然量化感知训练(Quantization-Aware Training, QAT)通过低位表示显著降低内存消耗且准确率损失最小,但因巨大的训练资源开销而难以实际应用。为此,我们提出更可行的高效量化感知训练(EfficientQAT)算法。EfficientQAT 包含两个连续阶段:参数全部分块训练(Block-AP)和量化参数端到端训练(E2E-QP)。我们所知第一方法使能对所有参数进行块级训练,通过增强优化过程的解空间来降低低位场景下的准确率损失。E2E-QP 随后对量化参数(步长)进行端到端训练,进一步通过考虑所有子模块的相互作用提升量化模型性能。广泛实验表明,EfficientQAT 在包括基础 LLM、指令调优 LLM 和多模态 LLM 在内的多种模型中表现优于先前方法,模型规模从 7B 到 70B 参数不等,量化位数各种常见。例如,EfficientQAT 能在单张 A100-80GB GPU 上完成 700 亿参数的 Llama-2-70B 2 位模型训练仅需 41 小时,准确率损失不足 3 分,达到 69.48 分(相对于原始 72.41 分)。代码已公开于 https://github.com/OpenGVLab/EfficientQAT。
引用
@article{arxiv.2407.11062,
title = {EfficientQAT: Efficient Quantization-Aware Training for Large Language Models},
author = {Mengzhao Chen and Wenqi Shao and Peng Xu and Jiahao Wang and Peng Gao and Kaipeng Zhang and Ping Luo},
journal= {arXiv preprint arXiv:2407.11062},
year = {2025}
}
备注
ACL 2025 Main, camera ready version