量化大语言模型的低秩校正
机器学习
2024-12-12 v1 机器学习
摘要
我们考虑大语言模型(LLM)在训练后压缩的问题,即仅使用少量校准输入数据来压缩一个训练良好的模型。在这项工作中,我们提出了一种新的低秩方法来校正 LLM 中激活值的量化误差:我们建议添加全精度低秩权重矩阵作用于未量化的激活值。然后我们求解一个联合优化问题,同时对权重量化表示和附加低秩权重矩阵进行量化,从而对权重和激活值同时进行量化。我们聚焦于 4 位权重与激活值量化(W4A4)的情况。使用相当于原始权重矩阵大小 10% 的秩,我们的方法将与原始模型的精度差距缩小超过 50%。使用相当于原始权重矩阵大小 30% 的秩,精度差距完全消除。我们在四个近期 LLM 上展示了结果,即 Llama-2、Llama-3、Phi-3 和 Mixtral 模型。
引用
@article{arxiv.2412.07902,
title = {Low-Rank Correction for Quantized LLMs},
author = {Meyer Scetbon and James Hensman},
journal= {arXiv preprint arXiv:2412.07902},
year = {2024}
}