Nesterov 加速梯度与动量作为正则化更新下降的近似
机器学习
2016-07-12 v2 机器学习
摘要
我们提出一个统一框架,用于调整基于梯度的迭代优化方法中的更新方向。作为自然特例,我们重新推导了经典动量和 Nesterov 加速梯度方法,为后者算法提供了新的直观解释。我们展示一种新算法,我们称之为正则化梯度下降(Regularised Gradient Descent),可以比 Nesterov 算法或经典动量算法收敛更快。
引用
@article{arxiv.1607.01981,
title = {Nesterov's Accelerated Gradient and Momentum as approximations to Regularised Update Descent},
author = {Aleksandar Botev and Guy Lever and David Barber},
journal= {arXiv preprint arXiv:1607.01981},
year = {2016}
}