为何Adam在$beta_1=beta_2$时效果更好:缺失的梯度尺度不变性原理
机器学习
2026-05-12 v2 人工智能
机器学习
摘要
Adam已在大规模训练中占据核心地位近十年,但仍有一项简单经验事实未被解释:当动量参数满足时,验证分数和训练运行的定性行为会有所改善。一些近期研究报道了这一模式,但仍无解释其为何有帮助的原因。我们指出,这一选择与我们称为“梯度尺度不变性”的结构属性密切相关。我们形式化了这一概念,并证明只有当时,Adam才具备一阶梯度尺度不变性。这一视角将Adam的平衡区间直接与最新几种强制执行尺度鲁棒更新的优化器的设计原则相吻合。理论通过在视觉和语言任务中,以及不同架构族中,对梯度进行重新缩放在时对更新影响显著更平滑。总体而言,我们的结果为Adam行为的一个开放问题提供了一致的解释,并提供了一个帮助指导未来优化器设计的简单原则。
引用
@article{arxiv.2601.21739,
title = {Why Adam Works Better with $\beta_1 = \beta_2$: The Missing Gradient Scale Invariance Principle},
author = {Alberto Fernández-Hernández and Cristian Pérez-Corral and Jose I. Mestre and Manuel F. Dolz and Enrique S. Quintana-Ortí},
journal= {arXiv preprint arXiv:2601.21739},
year = {2026}
}
备注
23 pages, 8 figures. Preprint