加速梯度下降比梯度下降更快逃离鞍点
机器学习
2017-11-29 v1 最优化与控制
机器学习
摘要
内斯特罗夫加速梯度下降(AGD)作为“动量法”一般族中的一员,在凸情形下可证明比梯度下降(GD)达到更快收敛速率。然而,这些方法在非凸情形下是否优于 GD 仍属开放问题。本文研究 AGD 的一个简单变体,并证明其以 次迭代逃离鞍点并找到二阶驻点,快于 GD 所需的 次迭代。据我们所知,这是首个无需 Hessian 即可比 GD 更快找到二阶驻点的算法,也是首个即使在寻找一阶驻点情形下也具有比 GD 更快速率的单循环算法。我们的分析基于两个关键思想:(1)受连续时间视角启发,使用一个简单的哈密顿函数,AGD 即使对非凸函数也逐步单调减小之;(2)一种称为“改进或局部化”的新框架,可用于追踪基于梯度的优化算法的长期行为。我们相信这些技术可深化我们对加速算法与非凸优化的理解。
引用
@article{arxiv.1711.10456,
title = {Accelerated Gradient Descent Escapes Saddle Points Faster than Gradient Descent},
author = {Chi Jin and Praneeth Netrapalli and Michael I. Jordan},
journal= {arXiv preprint arXiv:1711.10456},
year = {2017}
}