中文

Adam 优化器的锐更高阶收敛率

最优化与控制 2025-04-29 v1 人工智能

摘要

基于梯度下降的方法是机器学习中训练深度神经网络的首选方法。除了标准梯度下降方法外,也经常考虑包含加速技术(如动量法)和/或自适应技术(如 RMSprop 方法)的改进型梯度下降变体。如今,最受欢迎的这些高级优化方案可能是 2014 年由 Kingma 和 Ba 提出的 Adam 优化器。一个高度相关的研究主题是调查此类优化方法的收敛速度。特别是,1964 年 Polyak 证明了标准梯度下降法在严格局部极小值邻域内以速率 (x1)(x+1)1(x - 1)(x + 1)^{-1} 收敛,而动量法实现(最优)更快的收敛速率 (x1)(x+1)1(\sqrt{x} - 1)(\sqrt{x} + 1)^{-1},其中 x(1,)x \in (1, \infty) 为目标函数在局部极小值处 Hessian 特征值之比(即条件数)。本文的关键贡献在于揭示,Adam 也以速率 (x1)(x+1)1(\sqrt{x} - 1)(\sqrt{x} + 1)^{-1} 收敛,而 RMSprop 仅以收敛速率 (x1)(x+1)1(x - 1)(x + 1)^{-1} 收敛。

关键词

引用

@article{arxiv.2504.19426,
  title  = {Sharp higher order convergence rates for the Adam optimizer},
  author = {Steffen Dereich and Arnulf Jentzen and Adrian Riekert},
  journal= {arXiv preprint arXiv:2504.19426},
  year   = {2025}
}

备注

27 pages