LoFT:表现如同全量微调的低秩适配方法
机器学习
2026-03-10 v2 最优化与控制
摘要
大型预训练模型通常使用参数高效微调方法(如低秩适配(LoRA))来适配下游任务,该方法注入小的可训练低秩矩阵,而非更新所有权重。尽管 LoRA 以极小的开销大幅减少了可训练参数,但其在准确率上仍可能不及全量微调,且通常收敛较慢。我们引入了 LoFT,一种新型低秩适配方法,通过将优化器的内部动态与更新所有模型权重的动态对齐,使其表现如同全量微调。LoFT 不仅在低秩子空间中学习权重更新(如 LoRA),还将优化器的一阶矩和二阶矩(Adam 的动量和方差)适当地投影到同一子空间中,以模拟全模型更新。通过将低秩更新本身与全量更新对齐,LoFT 消除了调节额外超参数(例如 LoRA 缩放因子 )的需要。实验表明,该方法显著缩小了基于适配器的微调与全量微调之间的性能差距,并持续优于标准 LoRA 风格的方法,且不增加任何推理成本。
引用
@article{arxiv.2505.21289,
title = {LoFT: Low-Rank Adaptation That Behaves Like Full Fine-Tuning},
author = {Nurbek Tastan and Stefanos Laskaridis and Martin Takac and Karthik Nandakumar and Samuel Horvath},
journal= {arXiv preprint arXiv:2505.21289},
year = {2026}
}
备注
Accepted to ICLR 2026