中文

梯度权重归一化低秩投影:高效LLM训练方法

机器学习 2025-01-07 v2 人工智能

摘要

大型语言模型(LLM)在 various任务上表现卓越,但日益增长的计算资源需求为大规模下游任务的全参数微调带来了重大挑战。为此,已发展出参数高效微调(PEFT)方法,但它们常常不如全参数微调性能卓越,且在内存效率方面存在困难。本文引入了梯度权重归一化低秩投影(GradNormLoRP)一种新方法,旨在提升参数和内存效率,同时保持与全参数微调相当的性能。GradNormLoRP对权重矩阵进行归一化处理,以改善梯度条件,促进优化过程中的收敛。此外,它对权重和梯度矩阵应用低秩近似,显著降低训练期间的内存使用。大量实验表明,我们的8位GradNormLoRP在优化器内存使用方面降低最高可达89.5%,并使LLaMA 7B等大型LLM能在如NVIDIA RTX 4090等消费级GPU上进行预训练,无需额外推理成本。此外,GradNormLoRP在微调任务中超越了现有的低秩方法。例如,在采用秩为8时,对RoBERTa模型在所有GLUE任务上的微调,GradNormLoRP实现了平均分数80.65,超过LoRA的79.23分。这一结果凸显了GradNormLoRP作为高效LLM预训练和微调的有前景的替代方案。源代码:https://github.com/Jhhuangkay/Gradient-Weight-normalized-Low-rank-Projection-for-Efficient-LLM-Training

关键词

引用

@article{arxiv.2412.19616,
  title  = {Gradient Weight-normalized Low-rank Projection for Efficient LLM Training},
  author = {Jia-Hong Huang and Yixian Shen and Hongyi Zhu and Stevan Rudinac and Evangelos Kanoulas},
  journal= {arXiv preprint arXiv:2412.19616},
  year   = {2025}
}

备注

Accepted by the 39th AAAI Conference on Artificial Intelligence (AAAI-25) [Main Technical Track]