中文

量化大语言模型的低秩校正

机器学习 2024-12-12 v1 机器学习

摘要

我们考虑大语言模型(LLM)在训练后压缩的问题,即仅使用少量校准输入数据来压缩一个训练良好的模型。在这项工作中,我们提出了一种新的低秩方法来校正 LLM 中激活值的量化误差:我们建议添加全精度低秩权重矩阵作用于未量化的激活值。然后我们求解一个联合优化问题,同时对权重量化表示和附加低秩权重矩阵进行量化,从而对权重和激活值同时进行量化。我们聚焦于 4 位权重与激活值量化(W4A4)的情况。使用相当于原始权重矩阵大小 10% 的秩,我们的方法将与原始模型的精度差距缩小超过 50%。使用相当于原始权重矩阵大小 30% 的秩,精度差距完全消除。我们在四个近期 LLM 上展示了结果,即 Llama-2、Llama-3、Phi-3 和 Mixtral 模型。

关键词

引用

@article{arxiv.2412.07902,
  title  = {Low-Rank Correction for Quantized LLMs},
  author = {Meyer Scetbon and James Hensman},
  journal= {arXiv preprint arXiv:2412.07902},
  year   = {2024}
}