ADINE:一种随机梯度下降的自适应动量方法
机器学习
2017-12-21 v1 机器学习
摘要
在优化中取得巨大成功的两个主要基于动量的技术是Polyak的重球法和Nesterov的加速梯度法。所有基于动量的方法中的一个关键步骤是动量参数的选择,该参数总是被建议设为小于。尽管的选择仅在非常强的理论假设下才被证明合理,但即使假设不一定成立,它在实践中也表现良好。本文中,我们提出一种新的基于动量的方法,它放宽了的约束,并允许学习算法使用自适应的更高动量。我们通过实验验证更高动量()可帮助更快地逃离鞍点,从而激发关于的假设。利用这一动机,我们提出方法,其通过设定动量参数来更多地权衡先前的更新,在深度神经网络上评估我们所提算法,并表明帮助学习算法在不损害泛化误差的情况下更快收敛。
引用
@article{arxiv.1712.07424,
title = {ADINE: An Adaptive Momentum Method for Stochastic Gradient Descent},
author = {Vishwak Srinivasan and Adepu Ravi Sankar and Vineeth N Balasubramanian},
journal= {arXiv preprint arXiv:1712.07424},
year = {2017}
}
备注
8 + 1 pages, 12 figures, accepted at CoDS-COMAD 2018