中文

一种用于随机学习的自适应矩边界方法

机器学习 2019-10-29 v1 机器学习

摘要

训练深度神经网络需要精细的初始化与谨慎的学习率选择。基于过去梯度平方使用自适应学习率的随机梯度优化方法(如 AdaGrad、AdaDelta 和 Adam)的出现略微减轻了这一工作。然而,近期研究证明此类方法也存在自身缺陷,包括不收敛等问题。已有改进变体被提出,如 AMSGrad、AdaShift 和 AdaBound。本工作中,我们识别出自适应学习率方法的一个新问题:在学习的初始阶段 Adam 产生极大的学习率,抑制了学习的开始。我们提出自适应矩边界(AdaMod)方法,以自适应且基于矩的上界限制自适应学习率。动态学习率边界基于自适应学习率自身的指数移动平均,可平滑意外的大学习率并稳定深度神经网络的训练。我们的实验验证 AdaMod 消除了整个训练过程中的极大学习率,并相较 Adam 在 DenseNet 和 Transformer 等复杂网络上带来显著提升。我们的实现位于:https://github.com/lancopku/AdaMod

关键词

引用

@article{arxiv.1910.12249,
  title  = {An Adaptive and Momental Bound Method for Stochastic Learning},
  author = {Jianbang Ding and Xuancheng Ren and Ruixuan Luo and Xu Sun},
  journal= {arXiv preprint arXiv:1910.12249},
  year   = {2019}
}