中文

ADAM 的发散结果及其方差缩减版本的收敛性

机器学习 2026-01-30 v2 最优化与控制

摘要

使用过去梯度的指数移动平均的随机优化算法,如 ADAM、RMSProp 和 AdaGrad,已在许多应用中取得巨大成功,尤其在训练深度神经网络方面。ADAM 尤其以高效和鲁棒著称。尽管性能出色,ADAM 已被证明对某些特定问题发散。我们重新审视发散问题,并在更强条件(如期望意义下或高概率下)给出发散例子。在方差缩减假设下,我们证明一类 ADAM 型算法收敛,这意味着正是梯度的方差导致了原始 ADAM 的发散。为此,我们提出 ADAM 的方差缩减版本,并给出该算法的收敛分析。数值实验表明所提算法具有与 ADAM 同样良好的性能。我们的工作指出了修复收敛问题的一个新方向。

关键词

引用

@article{arxiv.2210.05607,
  title  = {Divergence Results and Convergence of a Variance Reduced Version of ADAM},
  author = {Ruiqi Wang and Diego Klabjan},
  journal= {arXiv preprint arXiv:2210.05607},
  year   = {2026}
}