一类Adam型算法在非凸优化上的收敛性研究
机器学习
2019-03-12 v2 最优化与控制
机器学习
摘要
本文研究一类基于自适应梯度的动量算法,其利用历史梯度同时更新搜索方向和学习率。我们将此类算法称为“Adam型”,包括Adam、AMSGrad和AdaGrad等流行算法。尽管这些算法在训练深度神经网络中很受欢迎,但它们在求解非凸问题时的收敛性仍是一个开放问题。本文提供了一组保证Adam型方法收敛的温和充分条件。我们证明,在导出的条件下,这些方法对非凸随机优化可达到 阶的收敛速率。我们表明这些条件是本质的,因为违背它们可能使算法发散。此外,我们提出并分析了一类(确定性的)增量自适应梯度算法,其具有相同的 收敛速率。我们的研究也可推广到机器学习与优化中更广义的一类自适应梯度方法。
引用
@article{arxiv.1808.02941,
title = {On the Convergence of A Class of Adam-Type Algorithms for Non-Convex Optimization},
author = {Xiangyi Chen and Sijia Liu and Ruoyu Sun and Mingyi Hong},
journal= {arXiv preprint arXiv:1808.02941},
year = {2019}
}