中文

LoRA 与全参数微调:等价性的幻觉

机器学习 2025-10-23 v3 计算与语言

摘要

微调是将预训练大语言模型适应于下游任务的关键范式。最近,像低秩适应(LoRA)这样的方法已被证明能够以极大幅度减少可训练参数的方式有效微调 LLM。但是,它们学习到的解真的等价吗?我们通过分析模型权重矩阵的谱性质,研究了 LoRA 和全参数微调如何改变预训练模型。我们发现,LoRA 和全参数微调产生的权重矩阵,其奇异值分解展现出截然不同的结构:使用 LoRA 训练的权重矩阵具有新的、高排名的奇异向量,我们称之为“入侵维度”,而使用全参数微调训练的权重矩阵则没有。此外,我们扩展了 LoRA 比全参数微调遗忘更少的发现,并发现其遗忘现象极大地局限于入侵维度——通过在微调后因果性地干预入侵维度(改变其相关的奇异值),我们证明了它们导致了遗忘。而且,显著缩小这些奇异值可以改善对预训练分布的建模,同时下游任务性能的下降极小。鉴于此,我们应该预期累积的入侵维度是有害的,并会导致更多的遗忘。在持续学习中,由于顺序微调,这种情况会被放大,我们展示了 LoRA 模型在此设置下确实会累积入侵维度,并且往往表现更差,这强调了我们发现的实践意义。

关键词

引用

@article{arxiv.2410.21228,
  title  = {LoRA vs Full Fine-tuning: An Illusion of Equivalence},
  author = {Reece Shuttleworth and Jacob Andreas and Antonio Torralba and Pratyusha Sharma},
  journal= {arXiv preprint arXiv:2410.21228},
  year   = {2025}
}