中文

AutoQRA:混合精度量化与低秩适配器的联合优化,用于高效 LLM 微调

机器学习 2026-02-27 v1

摘要

量化后进行参数高效微调已成为在 GPU 内存受限条件下进行下游适应的有前景的方法。然而,这一顺序管道未能充分利用量化位宽与 LoRA 秩之间的复杂相互作用。具体而言,经过精心优化的量化分配(即低量化误差)并不一定转化为强大的微调性能,不同的位宽和秩配置在相同的内存预算下可能导致显著不同的结果。为解决这一局限性,我们提出 AutoQRA,即联合优化框架,同时优化每个层的位宽和 LoRA 秩配置进行混合量化微调。为应对大型离散搜索空间和频繁微调迭代所导致的高评估成本,AutoQRA 将优化过程分解为两个阶段。首先进行全局多保真演化搜索,其中初始种群通过注入层级重要性先验进行温暖启动。该阶段采用特定算子和性能模型高效筛选候选配置。其次,对搜索空间的有希望区域应用信任区域贝叶斯优化,以在给定内存预算下识别最佳配置。该方法在训练期间可针对特定层主动补偿量化噪声。实验表明,AutoQRA 在接近全精度微调性能的同时,内存占用相当于统一 4 位方法。

关键词

引用

@article{arxiv.2602.22268,
  title  = {AutoQRA: Joint Optimization of Mixed-Precision Quantization and Low-rank Adapters for Efficient LLM Fine-Tuning},
  author = {Changhai Zhou and Shiyang Zhang and Yuhua Zhou and Qian Qiao and Jun Gao and Cheng Jin and Kaizhou Qin and Weizhong Zhang},
  journal= {arXiv preprint arXiv:2602.22268},
  year   = {2026}
}

备注

15 pages, 10 figures