中文

QDyLoRA:用于高效大型语言模型微调的量化动态低秩自适应

机器学习 2025-08-11 v1 计算与语言

摘要

微调大型语言模型需要巨大的 GPU 内存,限制了对更大模型的选择。虽然低秩自适应技术的量化版本 QLoRA 显著缓解了这一问题,但寻找高效的 LoRA 秩仍然具有挑战性。此外,QLoRA 在预定义的秩上进行训练,因此如果不进行进一步的微调步骤,就无法重新配置为更低的秩。本文提出了 QDyLoRA(量化动态低秩自适应),作为一种用于动态低秩自适应的高效量化方法。受 Dynamic LoRA 启发,QDyLoRA 能够在一组预定义的 LoRA 秩上高效微调 LLM。QDyLoRA 通过一轮微调,即可在单个 32 GB V100-GPU 上对 Falcon-40b 进行秩 1 到 64 的微调。实验结果表明,QDyLoRA 与 QLoRA 具有竞争力,并在使用其最优秩时表现更优。

关键词

引用

@article{arxiv.2402.10462,
  title  = {QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning},
  author = {Hossein Rajabzadeh and Mojtaba Valipour and Tianshu Zhu and Marzieh Tahaei and Hyock Ju Kwon and Ali Ghodsi and Boxing Chen and Mehdi Rezagholizadeh},
  journal= {arXiv preprint arXiv:2402.10462},
  year   = {2025}
}

备注

Best Paper Award AAAI EIW Workshop