中文

非均匀光滑性下 Adam 的收敛性:与 SGDM 的可分离性及超越

机器学习 2024-03-25 v1 最优化与控制

摘要

本文旨在从收敛速率的角度清晰区分带动量的随机梯度下降 (SGDM) 与 Adam。我们证明,在非均匀有界光滑性条件下,Adam 相比 SGDM 实现了更快的收敛。我们的发现揭示:(1) 在确定性环境中,Adam 可以达到确定性一阶优化器收敛速率的已知下界,而带动量的梯度下降 (GDM) 的收敛速率对初始函数值有更高阶的依赖;(2) 在随机设置中,Adam 的收敛速率上界匹配了随机一阶优化器的下界,同时考虑了初始函数值和最终误差,而存在 SGDM 在任何学习率下都无法收敛的情况。这些见解在收敛速率方面明确区分了 Adam 和 SGDM。此外,通过引入一种新颖的基于停时的技术,我们进一步证明,如果考虑迭代过程中的最小梯度范数,相应的收敛速率可以匹配所有问题超参数的下界。该技术还有助于证明具有特定超参数调度器的 Adam 是参数无关的,因此可能具有独立的研究价值。

关键词

引用

@article{arxiv.2403.15146,
  title  = {On the Convergence of Adam under Non-uniform Smoothness: Separability from SGDM and Beyond},
  author = {Bohan Wang and Huishuai Zhang and Qi Meng and Ruoyu Sun and Zhi-Ming Ma and Wei Chen},
  journal= {arXiv preprint arXiv:2403.15146},
  year   = {2024}
}