ADAM 的发散结果及其方差缩减版本的收敛性
机器学习
2026-01-30 v2 最优化与控制
摘要
使用过去梯度的指数移动平均的随机优化算法,如 ADAM、RMSProp 和 AdaGrad,已在许多应用中取得巨大成功,尤其在训练深度神经网络方面。ADAM 尤其以高效和鲁棒著称。尽管性能出色,ADAM 已被证明对某些特定问题发散。我们重新审视发散问题,并在更强条件(如期望意义下或高概率下)给出发散例子。在方差缩减假设下,我们证明一类 ADAM 型算法收敛,这意味着正是梯度的方差导致了原始 ADAM 的发散。为此,我们提出 ADAM 的方差缩减版本,并给出该算法的收敛分析。数值实验表明所提算法具有与 ADAM 同样良好的性能。我们的工作指出了修复收敛问题的一个新方向。
引用
@article{arxiv.2210.05607,
title = {Divergence Results and Convergence of a Variance Reduced Version of ADAM},
author = {Ruiqi Wang and Diego Klabjan},
journal= {arXiv preprint arXiv:2210.05607},
year = {2026}
}