中文

为何 Adam 能战胜 SGD:二阶矩归一化导致更尖锐的尾部

机器学习 2026-05-19 v8 人工智能

摘要

尽管 Adam 在许多应用中显示出比 SGD 更快的经验收敛速度,但现有理论大多提供的保证与 SGD 本身相当,留下了经验性能差距的解释不足。本文揭示了 Adam 中关键的二阶矩归一化机制,并开发了基于停止时间/鞅分析的证明方法,严格区分了 Adam 与 SGD 在经典有界方差模型(即二阶矩假设)下的收敛行为。特别地,我们首次在高概率收敛行为之间建立了理论分离:Adam 对置信参数 δ\delta 的依赖为 δ1/2\delta^{-1/2},而相应的 SGD 高概率保证必然具有 δ1\delta^{-1} 的依赖。

关键词

引用

@article{arxiv.2603.03099,
  title  = {Why Adam Can Beat SGD: Second-Moment Normalization Yields Sharper Tails},
  author = {Ruinan Jin and Yingbin Liang and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2603.03099},
  year   = {2026}
}

备注

68 pages