AdaRankGrad:用于内存高效的大语言模型训练与微调的自适应梯度秩和矩
机器学习
2025-12-09 v2
摘要
训练和微调大语言模型面临着与内存和计算需求相关的挑战,这是由于模型权重和优化器状态的规模不断增加。已经开发了各种技术来应对这些挑战,例如低秩适应,它涉及在每层固定的预训练权重旁边引入一个可训练的并行低秩矩阵。然而,这些方法通常不如全秩权重训练方法,因为它们将参数搜索限制在低秩子空间。这种限制可能会破坏训练动态,并需要全秩热启动来减轻影响。在本文中,我们介绍了一种新方法,其灵感来自我们正式证明的一个现象:随着训练的进行,估计的层梯度的秩逐渐减小,并渐近地趋近于秩一。利用这一点,我们的方法涉及在Adam优化步骤中自适应地降低梯度的秩,使用一种高效的在线更新低秩投影规则。我们进一步提出了一种随机SVD方案,用于高效地找到投影矩阵。我们的技术实现了具有自适应低秩梯度更新的全参数微调,与最先进的方法相比,显著降低了训练期间的整体内存需求,同时在预训练和微调中提高了模型性能。最后,我们提供了我们方法的收敛性分析,并展示了其在训练和微调语言及生物基础模型方面的优点。
引用
@article{arxiv.2410.17881,
title = {AdaRankGrad: Adaptive Gradient-Rank and Moments for Memory-Efficient LLMs Training and Fine-Tuning},
author = {Yehonathan Refael and Jonathan Svirsky and Boris Shustin and Wasim Huleihel and Ofir Lindenbaum},
journal= {arXiv preprint arXiv:2410.17881},
year = {2025}
}