Adam 算法的 ODE 近似:通用与过参数化情形
最优化与控制
2025-11-07 v1 机器学习
概率论
摘要
Adam 优化器目前可能是深度学习中最流行的优化方法。本文发展一种基于 ODE 的方法来研究 Adam 优化器在快慢比例(fast-slow scaling) regime 下的行为。对于固定动量参数和 vanishing 步长,我们证明 Adam 算法是特定向量场流(称为 Adam 向量场)的渐近伪轨迹(asymptotic pseudo-trajectory)。利用渐近伪轨迹的性质,我们为 Adam 算法建立收敛性结果。特别是在非常一般的情形下,我们证明如果 Adam 算法收敛,其极限必须是 Adam 向量场的零点,而非目标函数的局部最小化器或临界点。在相反的情况下,在过参数化的经验风险最小化情形中,Adam 算法能够在局部找到最小值集合。具体地,我们证明在全局最小值附近,目标函数是由 Adam 向量场诱导的流的 Lyapunov 函数。因此,如果 Adam 算法无限频繁地进入全局最小值附近,则其收敛于全局最小值集合。
引用
@article{arxiv.2511.04622,
title = {ODE approximation for the Adam algorithm: General and overparametrized setting},
author = {Steffen Dereich and Arnulf Jentzen and Sebastian Kassing},
journal= {arXiv preprint arXiv:2511.04622},
year = {2025}
}