重访 Adam:基于过去梯度加权的视角
机器学习
2021-01-05 v1 最优化与控制
摘要
自适应学习率方法已成功应用于许多领域,尤其在深度神经网络训练中。近期结果表明,对过去平方梯度采用指数增长权重(即 ADAM、RMSPROP)的自适应方法可能无法收敛到最优解。尽管已提出许多算法(如 AMSGRAD 和 ADAMNC)来修复不收敛问题,但获得类似于或优于 ADAGRAD 的依赖于数据的遗憾界对这些方法仍是一个挑战。本文中,我们提出一种新颖的自适应方法——加权自适应算法(WADA)来解决不收敛问题。与 AMSGRAD 和 ADAMNC 不同,我们考虑对平方过去梯度采用更温和的增长权重策略,其中权重线性增长。基于该思想,我们提出加权自适应梯度方法框架(WAGMF)并在此框架上实现 WADA 算法。此外,我们证明 WADA 能达到加权依赖于数据的遗憾界,当梯度快速下降时该界可优于 ADAGRAD 的原始遗憾界。该界可部分解释 ADAM 在实践中的良好表现。最后,大量实验证明了 WADA 及其变体在训练凸问题和深度神经网络时相对于若干 ADAM 变体的有效性。
引用
@article{arxiv.2101.00238,
title = {Adam revisited: a weighted past gradients perspective},
author = {Hui Zhong and Zaiyi Chen and Chuan Qin and Zai Huang and Vincent W. Zheng and Tong Xu and Enhong Chen},
journal= {arXiv preprint arXiv:2101.00238},
year = {2021}
}
备注
Zhong, Hui, et al. "Adam revisited: a weighted past gradients perspective." Frontiers of Computer Science 14.5 (2020): 1-16