Adam 及其他梯度下降优化方法的渐近稳定性与先验界
最优化与控制
2025-09-24 v1
摘要
基于梯度下降(GD)的优化方法是当今人工智能系统中训练深度神经网络的标准工具。在深度学习的优化过程中,所使用的优化器通常不是标准的 GD 方法,而是标准 GD 的合适自适应和加速变体(包括动量优化器和均方根传播(RMSprop)优化器)。由 Kingma 和 Ba 于 2014 年提出的自适应矩估计(Adam)优化器可能是此类基于自适应和加速 GD 的优化方法中最流行的变体。尽管这些复杂的优化方法很受欢迎,但为这类加速和自适应优化方法提供严格的数学分析仍然是一个根本性的开放研究问题。特别是,证明 Adam 优化器的有界性仍然是一个开放的研究问题。在这项工作中,我们针对一类简单的二次强凸随机优化问题解决了这个问题。具体来说,对于所考虑的随机优化问题类别,我们揭示了动量、RMSprop 和 Adam 的先验界。特别地,我们首次针对所考虑的强凸随机优化问题类别证明了 Adam 不会爆炸,而是在任何学习率选择下都保持有界。在这项工作中,我们还为深度学习优化器引入了某些稳定性概念——例如稳定性区域的概念——并且我们发现,在标准 GD、动量、RMSprop 和 Adam 中,Adam 是唯一一个既能达到最优高阶收敛速度,又具有最大稳定性区域的优化器。
引用
@article{arxiv.2509.10476,
title = {Asymptotic stability properties and a priori bounds for Adam and other gradient descent optimization methods},
author = {Steffen Dereich and Robin Graeber and Arnulf Jentzen and Adrian Riekert},
journal= {arXiv preprint arXiv:2509.10476},
year = {2025}
}
备注
60 pages, 7 figures