中文

随机化非对称 LoRA 链:低秩适配的首个有意义理论框架

机器学习 2024-10-14 v1 最优化与控制

摘要

微调是一种流行的做法,用于将大型基础模型适应特定任务。随着模型和数据集的规模不断增长,参数高效微调技术日益重要。一种最广泛使用的方法是低秩适配(LoRA),其适应更新表示为两个低秩矩阵的乘积。虽然 LoRA 在微调中表现出强大的性能,但与完整参数微调(FPFT)相比常常表现不佳。尽管已广泛研究了 LoRA 的许多变体,但其理论优化分析仍严重不足。我们的工作起点是演示 LoRA 及其两个扩展——非对称 LoRA 和 LoRA 链——确实遇到收敛问题。为解决这些问题,我们提出了随机化非对称 LoRA 链(RAC-LoRA)——一种一般性的优化框架,严格分析 LoRA 类方法的收敛速率。我们的ethods 继承了 LoRA 风格启发式方法的实证优势,但引入若干小而重要的算法修改,使其成为可证明收敛的方法。我们的框架在 FPFT 与低秩适配之间起到桥梁作用。我们提供了关于收敛到与 FPFT 相同解的可证明保证,以及收敛速率。此外,我们针对光滑非凸损失函数提供了收敛分析,涵盖梯度下降、随机梯度下降和联邦学习等情形。我们的理论发现得到实验结果的支持。

关键词

引用

@article{arxiv.2410.08305,
  title  = {Randomized Asymmetric Chain of LoRA: The First Meaningful Theoretical Framework for Low-Rank Adaptation},
  author = {Grigory Malinovsky and Umberto Michieli and Hasan Abed Al Kader Hammoud and Taha Ceritli and Hayder Elesedy and Mete Ozay and Peter Richtárik},
  journal= {arXiv preprint arXiv:2410.08305},
  year   = {2024}
}

备注

36 pages, 4 figures, 2 algorithms