理解 LoRA 的学习动态:矩阵分解中低秩适配的梯度流视角
机器学习
2025-03-11 v1 人工智能
摘要
尽管低秩适配(LoRA)在微调预训练模型中取得了经验上的成功,但对于采用精心设计的初始化的一阶方法如何将模型适配到新任务,目前几乎没有理论上的理解。在本工作中,我们迈出了弥合这一差距的第一步,在梯度流(GF)下从理论上分析了矩阵分解(MF)中 LoRA 的学习动态,强调了初始化的关键作用。对于小初始化,我们在理论上证明了 GF 收敛到最优解的一个邻域,且更小的初始化会导致更低的最终误差。我们的分析表明,最终误差受预训练模型与目标矩阵奇异空间之间错位的影响,减小初始化尺度可以改善对齐。为了解决这种错位,我们提出了一种用于 MF 中 LoRA 的谱初始化,并在理论上证明了具有小谱初始化的 GF 能以任意精度收敛到微调任务。来自 MF 和图像分类的数值实验验证了我们的发现。
引用
@article{arxiv.2503.06982,
title = {Understanding the Learning Dynamics of LoRA: A Gradient Flow Perspective on Low-Rank Adaptation in Matrix Factorization},
author = {Ziqing Xu and Hancheng Min and Lachlan Ewen MacDonald and Jinqi Luo and Salma Tarmoun and Enrique Mallada and Rene Vidal},
journal= {arXiv preprint arXiv:2503.06982},
year = {2025}
}