中文

利用随机动量更快逃离鞍点

机器学习 2021-06-08 v1

摘要

带随机动量的随机梯度下降(SGD)在非凸随机优化中广受欢迎,尤其用于深度神经网络训练。在标准 SGD 中,参数通过沿当前迭代点处一批样本梯度的路径更新,其中“动量”项的加入使更新偏向先前的参数变化方向。在非随机凸优化中,可证明动量调整在许多情形下缩短收敛时间,但此类结果在随机与非凸情形下一直难以取得。与此同时,一个被广泛观察到的经验现象是:训练深度网络时随机动量似乎显著改善收敛时间,其变体在其他流行更新方法(如 ADAM [KB15]、AMSGrad [RKK18] 等)的发展中大量涌现。然而随机动量使用的理论依据仍是一重大开放问题。本文给出一种解答:随机动量改善深度网络训练,是因为它修正 SGD 以更快逃离鞍点,从而更迅速地找到二阶驻点。我们的理论结果也阐明了如何选取理想动量参数这一相关问题——分析表明 β[0,1)\beta \in [0,1) 应取较大值(接近 1),这与经验发现一致。我们还提供实验发现进一步验证这些结论。

关键词

引用

@article{arxiv.2106.02985,
  title  = {Escaping Saddle Points Faster with Stochastic Momentum},
  author = {Jun-Kun Wang and Chi-Heng Lin and Jacob Abernethy},
  journal= {arXiv preprint arXiv:2106.02985},
  year   = {2021}
}

备注

Accepted at ICLR 2020