通过有符号梯度下降优化权值舍入以实现 LLM 量化
计算与语言
2024-10-10 v5 人工智能
机器学习
摘要
大语言模型(LLM)在语言相关任务中展现出卓越能力,但其部署因巨大的内存和存储需求而面临显著挑战。仅权值量化已成为一种有前景的解决方案,可在不过多牺牲性能的前提下大幅降低内存与存储需求。在本研究中,我们提出 SignRound,一种利用有符号梯度下降(SignSGD)在仅 200 步内优化舍入值和权值裁剪的方法。SignRound 融合了量化感知训练(QAT)与训练后量化(PTQ)的优势,在 2 至 4 比特下取得优异结果,同时将调优成本降至最低并避免额外推理开销。例如,在 2 比特下,按 11 项任务的平均零样本精度衡量,SignRound 取得了 6.91% 至 33.22% 的绝对平均精度提升。它还在近期模型中表现出强泛化能力,在大多数场景下实现近无损的 4 比特量化。源代码公开于 https://github.com/intel/auto-round。
引用
@article{arxiv.2309.05516,
title = {Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs},
author = {Wenhua Cheng and Weiwei Zhang and Haihao Shen and Yiyang Cai and Xin He and Kaokao Lv and Yi Liu},
journal= {arXiv preprint arXiv:2309.05516},
year = {2024}
}
备注
EMNLP24 Findings