基于信息保留的准确 LoRA 微调量化
机器学习
2024-05-28 v2 计算与语言
摘要
LoRA 微调量化已被广泛研究,以获得可部署于资源受限硬件上的准确且紧凑的大型语言模型(LLMs)。然而,现有方法导致量化后的 LLM 严重退化,甚至无法从 LoRA 微调中获益。本文提出一种新型 IR-QLoRA,通过信息保留技术实现对量化 LLM 进行高精度微调。我们的方法主要依赖两种从统一信息视角衍生的技术:(1) 基于统计学的信息校准量化(statistics-based Information Calibration Quantization),使量化后的 LLM 参数能准确保留原始信息;(2) 基于微调的信息弹性连接(finetuning-based Information Elastic Connection),使 LoRA 能够利用具有多样化信息的弹性表示转换。广泛实验表明,IR-QLoRA 在 LLaMA 和 LLaMA2 系列模型上可显著提升准确率,尤其在 2-4 位比特宽度下,例如 4 位 LLaMA-7B 在 MMLU 上的准确率提升 1.4%。该性能提升仅需额外 0.31% 的时间消耗,显示出 IR-QLoRA 的高效性。我们指出 IR-QLoRA 具有出色的通用性,兼容多种框架(如 NormalFloat 与 Integer 量化),并能为各种模型带来普遍的准确率提升。代码已公开于 https://github.com/htqin/ir-qlora。
引用
@article{arxiv.2402.05445,
title = {Accurate LoRA-Finetuning Quantization of LLMs via Information Retention},
author = {Haotong Qin and Xudong Ma and Xingyu Zheng and Xiaoyang Li and Yang Zhang and Shouda Liu and Jie Luo and Xianglong Liu and Michele Magno},
journal= {arXiv preprint arXiv:2402.05445},
year = {2024}
}