寻找 Adam 的秘方
机器学习
2025-12-02 v2
摘要
理解 Adam 在训练基于 Transformer 的语言模型时的卓越有效性,已成为优化界的一个核心研究课题。为了获得更深刻的见解,人们已经提出了 Adam 的几种简化方案,例如符号梯度和符号动量方法。在这项工作中,我们进行了广泛的实证研究——在不同的数据配置和规模下训练了超过 1500 个语言模型——将 Adam 与几种已知的简化变体进行比较。我们发现,符号动量方法比 SGD 更快,但相对于 Adam 始终表现不佳,即使在仔细调整动量、裁剪设置和学习率之后也是如此。然而,我们的分析揭示了一个引人注目的选择,它既能保持接近最优的性能,又能允许新的富有洞察力的重新表述:将 Adam 的动量参数约束为相等,即 beta1 = beta2。除了稳健的性能外,这一选择还提供了新的理论见解,突出了符号动量之上的“秘方”,并赋予了精确的统计解释:我们表明,Adam 在这种设置下实现了一种用于估计梯度均值和方差的自然在线算法——该算法源于平均场高斯变分推断的视角。
引用
@article{arxiv.2505.21829,
title = {In Search of Adam's Secret Sauce},
author = {Antonio Orvieto and Robert M. Gower},
journal= {arXiv preprint arXiv:2505.21829},
year = {2025}
}
备注
Accepted at NeurIPS 2025