中文

Adam 优化器的收敛速率

最优化与控制 2024-08-01 v1 机器学习 概率论 机器学习

摘要

随机梯度下降(SGD)优化方法如今是深度神经网络(DNNs)人工智能系统训练的首选方法。在实际相关的训练问题中,通常不采用纯粹的vanilla标准 SGD 方法,而是采用 suitably 加速和自适应的 SGD 优化方法。在 Adam 优化器由 Kingma & Ba 于 2014 年提出后,它成为此类加速和自适应 SGD 优化方法中最流行的变体。尽管 Adam 优化器在实际应用中广受欢迎,但迄今为止仍是一个研究问题,即在简单二次随机优化问题中(即目标函数(即要最小化的函数)为强凸的情况下)为 Adam 优化器提供收敛分析仍是开放的。在本文中,我们通过为大类随机优化问题建立最优收敛速率,解决了这一问题,特别是涵盖简单二次随机优化问题。我们收敛分析的关键要素是提出的一种称为 Adam 向量场的新型向量场函数。该 Adam 向量场准确描述了 Adam 优化过程的宏观行为,但与所考虑随机优化问题的目标函数(即要最小化的函数)的负梯度不同。特别是,我们的收敛分析揭示了,Adam 优化器通常不会收敛到目标函数的临界点(即目标函数梯度的零点)上,而是以收敛速率收敛到该 Adam 向量场的零点。

关键词

引用

@article{arxiv.2407.21078,
  title  = {Convergence rates for the Adam optimizer},
  author = {Steffen Dereich and Arnulf Jentzen},
  journal= {arXiv preprint arXiv:2407.21078},
  year   = {2024}
}