中文

利用自适应梯度方法逃离鞍点

机器学习 2020-02-04 v2 最优化与控制 机器学习

摘要

Adam 和 RMSProp 等自适应方法在深度学习中广泛使用,但其机理尚不清晰。在本文中,我们力求对其在非凸环境下的行为给出清晰、简洁且精确的刻画。为此,我们首先将自适应方法视为预条件 SGD 的一种新视角,其中预条件子以在线方式估计。通过单独研究该预条件子,我们阐明了其目的:在驻点附近将随机梯度噪声重标度为各向同性,从而有助于逃离鞍点。此外,我们表明自适应方法能够高效估计上述预条件子。将这两部分结合,我们给出了(据我们所知)首个针对任意自适应方法的二阶收敛结果。我们分析的关键见解是,与 SGD 相比,自适应方法逃离鞍点更快,并且总体上能更快地收敛到二阶驻点。

关键词

引用

@article{arxiv.1901.09149,
  title  = {Escaping Saddle Points with Adaptive Gradient Methods},
  author = {Matthew Staib and Sashank J. Reddi and Satyen Kale and Sanjiv Kumar and Suvrit Sra},
  journal= {arXiv preprint arXiv:1901.09149},
  year   = {2020}
}

备注

Update Theorem 4.1 and proof to use martingale concentration bounds, i.e. matrix Freedman