为何 Adam 能战胜 SGD:二阶矩归一化导致更尖锐的尾部
机器学习
2026-05-19 v8 人工智能
摘要
尽管 Adam 在许多应用中显示出比 SGD 更快的经验收敛速度,但现有理论大多提供的保证与 SGD 本身相当,留下了经验性能差距的解释不足。本文揭示了 Adam 中关键的二阶矩归一化机制,并开发了基于停止时间/鞅分析的证明方法,严格区分了 Adam 与 SGD 在经典有界方差模型(即二阶矩假设)下的收敛行为。特别地,我们首次在高概率收敛行为之间建立了理论分离:Adam 对置信参数 的依赖为 ,而相应的 SGD 高概率保证必然具有 的依赖。
引用
@article{arxiv.2603.03099,
title = {Why Adam Can Beat SGD: Second-Moment Normalization Yields Sharper Tails},
author = {Ruinan Jin and Yingbin Liang and Shaofeng Zou},
journal= {arXiv preprint arXiv:2603.03099},
year = {2026}
}
备注
68 pages