中文

重访归一化梯度下降:鞍点的快速逃逸

最优化与控制 2018-07-25 v3

摘要

本札记考虑归一化梯度下降(NGD),即经典梯度下降(GD)在优化问题中的自然修正。GD在非凸问题中的一个严重缺陷是,GD可能花费任意长的时间逃离鞍点邻域。该问题会使GD的收敛任意变慢,尤其在相对鞍点数量往往很大的高维非凸问题中。本文关注连续时间下降。研究表明,与标准GD相反,NGD“快速”逃逸鞍点。特别地,证明(i)NGD“几乎从不”收敛到鞍点,且(ii)NGD逃离鞍点 xx^* 周围半径为 rr 的球所需时长至多为 5κr5\sqrt{\kappa}r,其中 κ\kappaffxx^* 处Hessian的条件数。作为该结果的应用,在温和假设下建立了NGD的全局收敛时间界。

关键词

引用

@article{arxiv.1711.05224,
  title  = {Revisiting Normalized Gradient Descent: Fast Evasion of Saddle Points},
  author = {Ryan Murray and Brian Swenson and Soummya Kar},
  journal= {arXiv preprint arXiv:1711.05224},
  year   = {2018}
}