中文

关于 Adam 及其后续算法的收敛性

机器学习 2019-04-22 v1 最优化与控制 机器学习

摘要

近年来提出的若干随机优化方法,如 RMSProp、Adam、Adadelta、Nadam,已成功用于深度网络训练,它们基于对过去梯度平方的指数移动平均平方根进行缩放的梯度更新。在许多应用中,例如具有大规模输出空间的学习,经验观察表明这些算法无法收敛到最优解(或在非凸设定下收敛到临界点)。我们指出此类失败的一个原因是算法中使用的指数移动平均。我们给出一个简单凸优化设定的显式例子,其中 Adam 不收敛到最优解,并描述了先前 Adam 算法分析中的确切问题。我们的分析表明,通过赋予此类算法对过去梯度的“长期记忆”可修复收敛问题,并提出了 Adam 算法的新变体,其不仅修复了收敛问题,而且常带来改进的经验性能。

关键词

引用

@article{arxiv.1904.09237,
  title  = {On the Convergence of Adam and Beyond},
  author = {Sashank J. Reddi and Satyen Kale and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:1904.09237},
  year   = {2019}
}

备注

Appeared in ICLR 2018