自适应梯度方法在非凸优化中的收敛性
机器学习
2024-06-21 v4 最优化与控制
机器学习
摘要
自适应梯度方法是深度学习的支柱。然而,自适应梯度方法用于非凸优化的收敛保证尚未被深入研究。本文对包括 AMSGrad、RMSProp 与 AdaGrad 在内的广义自适应梯度方法给出了精细的收敛分析。对光滑非凸函数,我们证明自适应梯度方法在期望意义下收敛至一阶平稳点。就维度而言,我们的收敛速率优于已有的自适应梯度方法结果。此外,我们还证明了 AMSGrad、RMSProp 以及 AdaGrad 收敛速率的高概率界,这是此前未建立的。我们的分析有助于更好地理解自适应梯度方法在优化非凸目标时的内在机制。
引用
@article{arxiv.1808.05671,
title = {On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization},
author = {Dongruo Zhou and Jinghui Chen and Yuan Cao and Ziyan Yang and Quanquan Gu},
journal= {arXiv preprint arXiv:1808.05671},
year = {2024}
}
备注
25 pages, 2 tables. Published in Transactions on Machine Learning Research (TMLR)