中文

通过不同粒度的梯度低秩投影实现内存高效的大语言模型训练

机器学习 2025-05-06 v1

摘要

在低秩适配器(LoRA)成功的基础上,低秩梯度投影(LoRP)已成为一种有前景的内存高效微调解决方案。然而,现有的LoRP方法通常将梯度矩阵的每一行视为默认的投影单元,忽略了投影粒度的作用。在这项工作中,我们提出了一个新颖的框架VLoRP,它通过引入一个额外的自由度来控制内存效率与性能之间的权衡,该自由度超越了秩超参数。通过此框架,我们系统地探索了投影粒度的影响,证明即使在固定的内存预算下,更细粒度的投影也能带来更高的稳定性和效率。针对VLoRP的优化,我们提出了ProjFactor,一种自适应内存高效优化器,即使在存在梯度累积的情况下,也能显著降低内存需求,同时确保有竞争力的性能。此外,我们提供了VLoRP的理论分析,证明了其在SGD和ProjFactor下的优化轨迹的下降和收敛性。我们进行了广泛的实验来验证我们的发现,涵盖了常识推理、MMLU和GSM8K等任务。

关键词

引用

@article{arxiv.2505.01744,
  title  = {Memory-Efficient LLM Training by Various-Grained Low-Rank Projection of Gradients},
  author = {Yezhen Wang and Zhouhao Yang and Brian K Chen and Fanyi Pu and Bo Li and Tianyu Gao and Kenji Kawaguchi},
  journal= {arXiv preprint arXiv:2505.01744},
  year   = {2025}
}