中文

量化即时适配:面向量化 LLM 高效微调的配置感知 LoRA

机器学习 2026-04-13 v3 人工智能

摘要

随着越来越大的预训练模型被发布,将其部署在边缘设备上以用于隐私保护应用需要有效的压缩。近期的工作将量化与高精度 LoRA 适配器的微调相结合,这可以在减轻量化导致的精度损失的同时显著减小模型大小。然而,边缘设备具有固有的异构能力,而为每种量化配置执行配置级微调在计算上是不可行的。在本文中,我们提出了 CoA-LoRA,一种无需重复微调即可将 LoRA 适配器动态调整至任意量化配置(即预训练模型的每层位宽选择)的方法。这通过一个配置感知模型来实现,该模型将每种配置映射至其低秩调整。该模型的有效性关键取决于训练配置集,即选择用于覆盖不同总位宽预算的配置集合。然而,构建高质量的配置集并非易事。因此,我们设计了一种基于 Pareto 的配置搜索,迭代地优化训练配置集,从而产生更精确的低秩调整。我们的实验表明,与需要为每种配置微调单独的 LoRA 适配器的 SOTA 方法不同,CoA-LoRA 不会产生额外的时间成本,同时取得与这些方法相当甚至更优的性能。

关键词

引用

@article{arxiv.2509.25214,
  title  = {On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs},
  author = {Rongguang Ye and Ming Tang and Edith C. H. Ngai},
  journal= {arXiv preprint arXiv:2509.25214},
  year   = {2026}
}