重访归一化梯度下降:鞍点的快速逃逸
最优化与控制
2018-07-25 v3
摘要
本札记考虑归一化梯度下降(NGD),即经典梯度下降(GD)在优化问题中的自然修正。GD在非凸问题中的一个严重缺陷是,GD可能花费任意长的时间逃离鞍点邻域。该问题会使GD的收敛任意变慢,尤其在相对鞍点数量往往很大的高维非凸问题中。本文关注连续时间下降。研究表明,与标准GD相反,NGD“快速”逃逸鞍点。特别地,证明(i)NGD“几乎从不”收敛到鞍点,且(ii)NGD逃离鞍点 周围半径为 的球所需时长至多为 ,其中 为 在 处Hessian的条件数。作为该结果的应用,在温和假设下建立了NGD的全局收敛时间界。
引用
@article{arxiv.1711.05224,
title = {Revisiting Normalized Gradient Descent: Fast Evasion of Saddle Points},
author = {Ryan Murray and Brian Swenson and Soummya Kar},
journal= {arXiv preprint arXiv:1711.05224},
year = {2018}
}