中文

LoRAQuant:面向超低位宽的 LoRA 混合精度量化

机器学习 2025-11-10 v2

摘要

低秩适应 (LoRA) 已成为大型语言模型 (LLM) 参数高效微调的流行技术。在许多实际场景中,需要同时加载多个适配器以实现针对个性化用户体验或支持多样化任务的 LLM 定制。尽管每个适配器在单独使用时都很轻量级,但在大规模部署时其累计成本会变得相当可观。为此,我们提出了 LoRAQuant,一种针对 LoRA 的混合精度后训练量化方法。具体而言,LoRAQuant 通过奇异值分解 (SVD) 对每个适配器进行再参数化,将最重要的信息浓缩到特定的行和列。这使得可以将关键组件量化为更高精度,而将其余部分量化为超低位宽。我们在数学推理、编码和摘要任务上对 LLaMA 2-7B、LLaMA 2-13B 和 Mistral 7B 模型进行了全面实验。结果表明,我们的 LoRAQuant 使用的位数显著低于其他量化方法,但实现了可与之相当甚至更高的性能。

关键词

引用

@article{arxiv.2510.26690,
  title  = {LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits},
  author = {Amir Reza Mirzaei and Yuqiao Wen and Yanshuai Cao and Lili Mou},
  journal= {arXiv preprint arXiv:2510.26690},
  year   = {2025}
}