带加权聚合与动量加速的 AdaGrad 统一分析
机器学习
2023-05-16 v4 数值分析
最优化与控制
机器学习
摘要
将自适应学习率与动量技术融入 SGD 产生了一大类中高效加速的自适应随机算法,如 AdaGrad、RMSProp、Adam、AccAdaGrad 等。尽管它们在实践中有效,其收敛理论仍存在较大缺口,尤其在困难的非凸随机设定下。为填补该缺口,我们提出加权 AdaGrad 与统一动量(称为 AdaUSM),其主要特征为:(1) 它包含统一动量方案,涵盖重球动量与 Nesterov 加速梯度动量;(2) 它采用新颖的加权自适应学习率,可统一 AdaGrad、AccAdaGrad、Adam 与 RMSProp 的学习率。此外,当在 AdaUSM 中取多项式增长权重时,我们在非凸随机设定下得到其 O(log(T)/√T) 收敛速率。我们也表明 Adam 与 RMSProp 的自适应学习率对应于在 AdaUSM 中取指数增长权重,从而为理解 Adam 与 RMSProp 提供新视角。最后,我们还在多种深度学习模型与数据集上进行了 AdaUSM 对比带动量的 SGD、AdaGrad、AdaEMA、Adam 与 AMSGrad 的实验。
引用
@article{arxiv.1808.03408,
title = {A Unified Analysis of AdaGrad with Weighted Aggregation and Momentum Acceleration},
author = {Li Shen and Congliang Chen and Fangyu Zou and Zequn Jie and Ju Sun and Wei Liu},
journal= {arXiv preprint arXiv:1808.03408},
year = {2023}
}
备注
IEEE TNNLS