中文

Bi-LoRA: 大规模模型微调的高效锐度感知最小化

机器学习 2026-04-21 v2 人工智能

摘要

用有限数据微调大规模预训练模型在泛化方面面临重大挑战。虽然锐度感知最小化(SAM)已被证明能通过寻找平坦极小值来改善泛化,但其显著的额外内存和计算开销使其难以应用于大规模模型。将 SAM 与参数高效微调方法(如低秩适配 LoRA)结合是一个有前景的方向。然而,我们发现直接将 SAM 应用于 LoRA 参数会将锐度优化限制在受限子空间中,削弱其效果。为解决这一局限,我们提出双向低秩适配(Bi-LoRA),引入一个辅助 LoRA 模块来建模 SAM 的对抗性权重扰动。它将 SAM 的权重扰动与 LoRA 优化解耦:主 LoRA 模块通过标准梯度下降适应特定任务,而辅助模块通过梯度上升捕捉损失曲面的锐度。这种双模块设计使 Bi-LoRA 能够捕获更广泛的锐度以实现更平坦的极小值,同时保持内存高效。另一个重要优势是双模块设计允许同时优化和扰动,消除了 SAM 加倍的训练成本。在多样化任务和架构上的广泛实验证明了 Bi-LoRA 在提升泛化方面的效率和有效性。

关键词

引用

@article{arxiv.2508.19564,
  title  = {Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models},
  author = {Yuhang Liu and Tao Li and Zhehao Huang and Zuopeng Yang and Xiaolin Huang},
  journal= {arXiv preprint arXiv:2508.19564},
  year   = {2026}
}

备注

32 pages,ICLR 2026