中文

LQ-LoRA:用于高效语言模型微调的低秩加量化矩阵分解

计算与语言 2024-08-28 v4 机器学习

摘要

我们提出了一种用于预训练语言模型内存高效适配的简单方法。我们的方法使用迭代算法将每个预训练矩阵分解为高精度低秩分量和内存高效的量化分量。在微调过程中,量化分量保持固定,仅更新低秩分量。我们给出了量化分量的整数线性规划公式,使得在给定的总体目标内存预算下,可对每个矩阵的量化参数(如位宽、块大小)进行动态配置。我们进一步探索了该算法的数据感知版本,其利用 Fisher 信息矩阵的近似在矩阵分解过程中对重构目标进行加权。在微调 RoBERTa 和 LLaMA-2(7B 和 70B)上的实验表明,我们的低秩加量化矩阵分解方法(LQ-LoRA)优于强大的 QLoRA 和 GPTQ-LoRA 基线,并能够实现激进的亚 3 比特量化且仅有轻微性能下降。当在语言建模校准数据集上微调时,LQ-LoRA 也可用于模型压缩;在此设定下,我们的 2.75 比特 LLaMA-2-70B 模型(在包含低秩分量后平均 2.85 比特,需要 27GB GPU 内存)与 16 比特基线相比表现尚可。

关键词

引用

@article{arxiv.2311.12023,
  title  = {LQ-LoRA: Low-rank Plus Quantized Matrix Decomposition for Efficient Language Model Finetuning},
  author = {Han Guo and Philip Greengard and Eric P. Xing and Yoon Kim},
  journal= {arXiv preprint arXiv:2311.12023},
  year   = {2024}
}