中文

无 SVD 方法下的准粒子子空间迭代 LoRA 及其对角分数 K-FAC

机器学习 2026-02-19 v1

摘要

低秩适应(LoRA)通过在冻结的权重上学习低秩更新来进行微调,显著减少可训练参数和内存占用。本文致力于缩小使用全步骤低秩投影(SVDLoRA)与 LoRA 微调之间的差距。我们提出了 LoRSum—a 一种内存高效的子程序,通过将 LoRA 优化建模为准粒子子问题并采用交替最小二乘更新求解,从而高效地闭合这一差距。我们证明了该方法等价于隐式的块幂方法。我们将若干近期提出的 LoRA 预条件化方法恢复为特例,并表明 LoRSum 亦可用于更新低秩动量。为实现带预条件化梯度下降的全步骤更新,我们提出了 LoRSum 的一个缩放变体,采用结构化度量(如 K-FAC 与 Shampoo),并表明仅存储这些度量的对角项即可在保持较好性能的同时实现内存效率。在合成任务、CIFAR-100 以及 GLUE、SQuAD v2、WikiText-103 上的语言模型微调实验中,我们的方法在适度计算开销下能够匹配或提升 LoRA 基线,同时避免完整矩阵的 SVD 投影,保持 LoRA 风格的参数高效性。

关键词

引用

@article{arxiv.2602.16456,
  title  = {Beyond SGD, Without SVD: Proximal Subspace Iteration LoRA with Diagonal Fractional K-FAC},
  author = {Abdulla Jasem Almansoori and Maria Ivanova and Andrey Veprikov and Aleksandr Beznosikov and Samuel Horváth and Martin Takáč},
  journal= {arXiv preprint arXiv:2602.16456},
  year   = {2026}
}

备注

20 pages, 5 figures, 4 tables