中文

低秩适应中的幅度优势性

机器学习 2025-12-29 v2 人工智能

摘要

低秩适应(Low-Rank Adaptation, LoRA)提供了一种高效微调大型模型的方法。虽然最近的谱初始化方法在收敛性和性能上优于原始的“Noise & Zeros”方案,但其额外的计算和存储开销削弱了效率。本文建立了更新幅度作为 LoRA 性能驱动力的基本原理,提出 LoRAM—a 一种基于幅度驱动的“Basis & Basis”初始化方案,在不附加额外计算和存储开销的同时,匹配谱方法的效果。我们的主要贡献有三点:(i) 权重更新的幅度决定收敛性。我们证明低秩结构本质上限制了更新幅度,将学习率、缩放因子和初始化等超参数调优统一为优化幅度调控的机制。(ii) 谱初始化之所以成功,源于幅度的放大。我们解构了谱分量所谓的知识驱动效应,实际上就是对权重更新幅度的提升。(iii) 提出一种新型且紧凑的初始化策略 LoRAM,通过对预训练权重幅度进行尺度化,模拟谱方法的收益。广泛的实验表明,LoRAM 作为强基准,保留了 LoRA 的全部效率优势,同时在多个基准上实现了与或超越谱初始化的性能。

关键词

引用

@article{arxiv.2507.06558,
  title  = {The Primacy of Magnitude in Low-Rank Adaptation},
  author = {Zicheng Zhang and Haoran Li and Yifeng Zhang and Guoqiang Gong and Jiaxing Wang and Junxing Hu and Pengzhang Liu and Qixia Jiang},
  journal= {arXiv preprint arXiv:2507.06558},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025, spotlight