AltLoRA:通过交替投影实现低秩适应中的更好梯度逼近
机器学习
2025-09-30 v2
摘要
低秩适应(LoRA) emerged 作为降低大型语言模型微调内存开销的有效技术,但常因更新受限于低秩空间而不如完整微调性能理想。近期变体如 LoRA-Pro 试图通过调整低秩矩阵的梯度来逼近完整梯度以缓解此问题。然而,LoRA-Pro 的解决方案并非唯一,不同解决方案在消融研究中可能导致显著性能差异。此外,为融合动量或自适应优化设计,像 LoRA-Pro 这样的方法必须首先计算等效梯度,导致内存开销接近完整微调。一个关键挑战仍在于以更低的内存成本将动量正确地集成到低秩空间中。本文提出 AltLoRA,一种交替投影方法,既规避了联合更新设计带来的梯度逼近困难,又在无更高内存复杂度下集成动量。我们的理论分析提供收敛保证,并进一步表明 AltLoRA 能够实现稳定的特征学习和对转换不变性的鲁棒性。广泛的实验表明,AltLoRA 在多个任务上均优于 LoRA 及其变体,缩小了与完整微调的差距,同时保持卓越的内存效率。
引用
@article{arxiv.2505.12455,
title = {AltLoRA: Towards Better Gradient Approximation in Low-Rank Adaptation with Alternating Projections},
author = {Xin Yu and Yujia Wang and Jinghui Chen and Lingzhou Xue},
journal= {arXiv preprint arXiv:2505.12455},
year = {2025}
}