通过最优平衡实现对量化大型语言模型的精准高效微调
机器学习
2025-07-23 v2
摘要
大型语言模型(LLM)在 various 领域展现出惊人的性能。然而,庞大的模型参数使微调变得具有挑战性,显著限制了其应用和部署。现有解决方案将参数量化与低秩适应(LoRA)组合,虽减少了内存占用,但导致性能下降。此外,将微调后的模型转换为低精度表示还会进一步降低性能。本文识别出在量化LLM上进行LoRA微调时存在的不平衡问题:适配器的输入输出过于复杂,而适配器的实际可训练性较低,导致微调时出现欠拟合。因此,我们提出了一种称为Q-BLoRA(Balanced Low-Rank Adaptation)的量化LLM微调方法,通过简化适配器的输入输出并增加适配器的秩来缓解微调中的欠拟合问题。对于低精度部署,我们提出了一种称为QA-BLoRA(Quantization-Aware fine-tuning with Balanced Low-Rank Adaptation)的量化感知微调方法,基于Q-BLoRA的参数合并,与块级量化相容,促进了基于平衡低秩适应的量化感知微调。Q-BLoRA和QA-BLoRA都容易实现,并提供以下优化:(i)Q-BLoRA在各种基线和其他变体中始终实现最先进的精度;(ii)QA-BLoRA enables the direct generation of low-precision inference models,这些模型在其他低精度模型之上显著性能提升。我们在 various 模型和情景下验证了Q-BLoRA和QA-BLoRA的有效性。代码将在 \href{https://github.com/xiaocaigou/qbaraqahira}{https://github.com/xiaocaigou/qbaraqahira} 公开。
引用
@article{arxiv.2407.17029,
title = {Accurate and Efficient Fine-Tuning of Quantized Large Language Models Through Optimal Balance},
author = {Ao Shen and Qiang Wang and Zhiquan Lai and Xionglve Li and Dongsheng Li},
journal= {arXiv preprint arXiv:2407.17029},
year = {2025}
}