关于LoRA梯度下降收敛率的分析
机器学习
2026-05-12 v3
摘要
低秩适应(LoRA)算法因其卓越的性能和低计算需求而在最近年来广受流行,用于大模型的微调。LoRA训练两个"适配器"矩阵,形成模型参数的低秩表示,从而大幅减少每一步需要更新的参数数量。尽管LoRA简单易用,但由于缺乏Lipschitz光滑性——经典收敛分析的关键条件——其收敛性仍不为人所了解。因此,当前的理论结果仅考虑渐近行为,或假设强大的有界性条件以人为强制实现Lipschitz光滑性。在本工作中,我们首次对"原始LoRA梯度下降"算法进行非渐近收敛分析,该算法反映了实际应用中的常见做法,无需此类假设。我们的工作包含三个关键步骤:i) 将问题重新表述为堆叠适配器矩阵的外积;ii) 针对"类Lipschitz"重参数化函数提出修正的下降引理;iii) 控制步长。通过此方法,我们证明LoRA梯度下降以的速度收敛到平稳点,其中为迭代次数。我们进行数值实验以验证理论发现。
引用
@article{arxiv.2512.18248,
title = {On the Convergence Rate of LoRA Gradient Descent},
author = {Siqiao Mu and Diego Klabjan},
journal= {arXiv preprint arXiv:2512.18248},
year = {2026}
}
备注
ICML 2026