Adam 优化器的锐更高阶收敛率
最优化与控制
2025-04-29 v1 人工智能
摘要
基于梯度下降的方法是机器学习中训练深度神经网络的首选方法。除了标准梯度下降方法外,也经常考虑包含加速技术(如动量法)和/或自适应技术(如 RMSprop 方法)的改进型梯度下降变体。如今,最受欢迎的这些高级优化方案可能是 2014 年由 Kingma 和 Ba 提出的 Adam 优化器。一个高度相关的研究主题是调查此类优化方法的收敛速度。特别是,1964 年 Polyak 证明了标准梯度下降法在严格局部极小值邻域内以速率 收敛,而动量法实现(最优)更快的收敛速率 ,其中 为目标函数在局部极小值处 Hessian 特征值之比(即条件数)。本文的关键贡献在于揭示,Adam 也以速率 收敛,而 RMSprop 仅以收敛速率 收敛。
引用
@article{arxiv.2504.19426,
title = {Sharp higher order convergence rates for the Adam optimizer},
author = {Steffen Dereich and Arnulf Jentzen and Adrian Riekert},
journal= {arXiv preprint arXiv:2504.19426},
year = {2025}
}
备注
27 pages