随机梯度下降在自适应步长下的收敛性
机器学习
2019-02-28 v3 机器学习
最优化与控制
摘要
随机梯度下降是大规模优化机器学习目标函数的首选方法。然而,其性能差异很大,且严重依赖于步长的选择。这促使了大量关于自适应步长的研究。但目前我们对这些方法的理论理解存在缺口,尤其是在非凸设定下。本文着手弥补这一缺口:我们在凸和非凸设定下对 AdaGrad 步长的一个广义版本进行理论分析。我们给出了这些步长实现梯度几乎必然渐近收敛于零的充分条件,证明了广义 AdaGrad 步长在非凸设定下的首个保证。此外,我们表明这些步长允许在凸和非凸设定下自动适应随机梯度的噪声水平,在 与 之间插值(直至对数项)。
引用
@article{arxiv.1805.08114,
title = {On the Convergence of Stochastic Gradient Descent with Adaptive Stepsizes},
author = {Xiaoyu Li and Francesco Orabona},
journal= {arXiv preprint arXiv:1805.08114},
year = {2019}
}
备注
More discussion on related work