AdaGrad 结合 Muon:正交更新的自适应步长
机器学习
2025-09-09 v2 最优化与控制
摘要
最近提出的 Muon 优化器通过正交化动量更新权重矩阵,在大型语言模型训练中展现出强大的经验成功。然而,如何确定此类正交化更新的学习率尚不明了。相比之下,AdaGrad 是一种广泛使用的自适应方法,通过累积过去梯度来缩放随机梯度。我们提出了一种新算法 AdaGO,将基于范数的 AdaGrad 类型步长与正交化更新方向相结合,融合了两种方法的优势。与 Muon 的其他自适应变体不同,AdaGO 保持更新方向的正交性,这可被解释为一种谱降维方向,同时通过缩放累积过去梯度范数来适应优化景观中的步长。AdaGO 的实现只需对 Muon 进行最小的修改,即可计算一个额外的标量变量——累积平方梯度范数,从而在计算和内存效率方面具有优势。在标准光滑性和无偏有界方差噪声假设下,我们为非凸函数建立了最优理论收敛率,适用于随机和确定性情形。在 CIFAR-10 分类和函数回归等实验中,AdaGO 在性能上优于 Muon 和 Adam。
引用
@article{arxiv.2509.02981,
title = {AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates},
author = {Minxin Zhang and Yuxuan Liu and Hayden Schaeffer},
journal= {arXiv preprint arXiv:2509.02981},
year = {2025}
}