具有韧性与动量的自适应梯度方法
机器学习
2020-10-22 v1 最优化与控制
摘要
为提升深度神经网络训练的有效性与效率,已提出随机梯度下降(SGD)的若干变体,其中一些近期有影响力的尝试希望自适应控制逐参数学习率(如 Adam 和 RMSProp)。尽管它们在收敛速度上表现出较大提升,但大多数自适应学习率方法相比 SGD 存在泛化性能受损的问题。本文受网络参数振荡减缓训练的观察启发,提出一种具有韧性与动量的自适应梯度方法(AdaRem),并给出收敛性的理论证明。对于每个参数,AdaRem 根据该参数过去更新方向是否与当前梯度方向一致来调整逐参数学习率,从而以少得多的振荡鼓励长期一致的参数更新。我们进行了全面的实验,在大规模图像识别数据集(如 ImageNet)上训练多种模型来验证 AdaRem 的有效性,实验也表明我们的方法在训练速度和测试误差方面分别优于先前基于自适应学习率的算法。
引用
@article{arxiv.2010.11041,
title = {Adaptive Gradient Method with Resilience and Momentum},
author = {Jie Liu and Chen Lin and Chuming Li and Lu Sheng and Ming Sun and Junjie Yan and Wanli Ouyang},
journal= {arXiv preprint arXiv:2010.11041},
year = {2020}
}