中文

Grams:带自适应动量缩放的梯度下降

机器学习 2025-03-06 v3 人工智能 数据结构与算法 最优化与控制

摘要

我们提出了一种名为 G\mathbf{G}radient Descent with A\mathbf{A}daptive M\mathbf{M}omentum S\mathbf{S}caling (Grams\mathbf{Grams}) 的新型优化算法,旨在深度学习中解耦参数更新的方向与幅度。与传统优化器直接将动量积分到更新中的不同,Grams 将更新方向从当前梯度中分离出来,而动量仅用于自适应幅度缩放。这种方法使 Grams 能够在损失下降方面优于当前最先进的谨慎型和动量型优化器。我们理论上证明了 Grams 的收敛速度快于其他当前最先进的优化器,并为 Grams 建立了全局收敛保证。我们还通过大量实验验证了其有效性。结果表明,Grams 在收敛速度和泛化能力方面,均优于诸如 Adam、Lion 及其谨慎变体等广泛使用的优化器。我们的结果凸显了 Grams 在高效训练和微调大型语言模型方面的潜力。代码已公开于 https://github.com/Gunale0926/Grams。

关键词

引用

@article{arxiv.2412.17107,
  title  = {Grams: Gradient Descent with Adaptive Momentum Scaling},
  author = {Yang Cao and Xiaoyu Li and Zhao Song},
  journal= {arXiv preprint arXiv:2412.17107},
  year   = {2025}
}

备注

SCOPE Workshop @ ICLR 2025