Grams:带自适应动量缩放的梯度下降
机器学习
2025-03-06 v3 人工智能
数据结构与算法
最优化与控制
摘要
我们提出了一种名为 radient Descent with daptive omentum caling () 的新型优化算法,旨在深度学习中解耦参数更新的方向与幅度。与传统优化器直接将动量积分到更新中的不同,Grams 将更新方向从当前梯度中分离出来,而动量仅用于自适应幅度缩放。这种方法使 Grams 能够在损失下降方面优于当前最先进的谨慎型和动量型优化器。我们理论上证明了 Grams 的收敛速度快于其他当前最先进的优化器,并为 Grams 建立了全局收敛保证。我们还通过大量实验验证了其有效性。结果表明,Grams 在收敛速度和泛化能力方面,均优于诸如 Adam、Lion 及其谨慎变体等广泛使用的优化器。我们的结果凸显了 Grams 在高效训练和微调大型语言模型方面的潜力。代码已公开于 https://github.com/Gunale0926/Grams。
引用
@article{arxiv.2412.17107,
title = {Grams: Gradient Descent with Adaptive Momentum Scaling},
author = {Yang Cao and Xiaoyu Li and Zhao Song},
journal= {arXiv preprint arXiv:2412.17107},
year = {2025}
}
备注
SCOPE Workshop @ ICLR 2025