梯度下降逃离鞍点可能耗时指数级时间
最优化与控制
2017-11-07 v2 机器学习
机器学习
摘要
尽管梯度下降(GD)几乎总能渐近地逃离鞍点 [Lee et al., 2016],本文表明,即使采用相当自然的随机初始化方案和非病态函数,GD 仍可能因鞍点而显著减速,需要指数级时间才能逃离。另一方面,带扰动的梯度下降 [Ge et al., 2015, Jin et al., 2017] 则不会被鞍点拖慢——它能在多项式时间内找到一个近似局部极小点。这一结果意味着 GD 本质上比扰动 GD 慢,并证明了为非凸优化添加扰动的重要性。虽然我们的重点是理论性的,但我们也展示了实验来佐证理论发现。
引用
@article{arxiv.1705.10412,
title = {Gradient Descent Can Take Exponential Time to Escape Saddle Points},
author = {Simon S. Du and Chi Jin and Jason D. Lee and Michael I. Jordan and Barnabas Poczos and Aarti Singh},
journal= {arXiv preprint arXiv:1705.10412},
year = {2017}
}
备注
Accepted by NIPS 2017