中文

从符号类下降视角下的 Adam 优化器简单收敛性证明

机器学习 2025-07-10 v1 人工智能 信息论 math.IT

摘要

Adam 被广泛认为是训练深度神经网络(DNN)最有效的优化器之一。尽管其在实践中取得了显著成功,但其理论收敛分析仍不令人满意。现有工作主要将 Adam 解释为带动量的预条件随机梯度下降(SGDM),公式为 xt+1=xtγtvt+ϵmt\bm{x}_{t+1} = \bm{x}_t - \frac{\gamma_t}{{\sqrt{\bm{v}_t}+\epsilon}} \circ \bm{m}_t。这种视角需要强假设且技术复杂,导致冗长且晦涩的收敛性证明,难以验证和推广。相反,我们提出一种新颖的解释,将 Adam 视为符号类优化器,公式为 xt+1=xtγtmtvt+ϵSign(mt)\bm{x}_{t+1} = \bm{x}_t - \gamma_t \frac{|\bm{m}_t|}{{\sqrt{\bm{v}_t}+\epsilon}} \circ {\rm Sign}(\bm{m}_t)。这种改写显著简化了收敛性分析。首次在广义 pp-仿射方差和 (L0,L1,q)(L_0, L_1, q)-光滑性弱假设下,我们证明 Adam 实现最优收敛率 O(1T\sfrac14){\cal O}(\frac{1}{T^{\sfrac{1}{4}}}),而非以往在高维模型或数值稳定参数 ϵ\epsilon 依赖下的 O(lnTT\sfrac14){\cal O} \left(\frac{\ln T}{T^{\sfrac{1}{4}}}\right)。此外,我们的理论分析为动量作为收敛关键因素提供新见解,并给出 Adam 学习率调参的实用指导,进一步弥合了理论与实践之间的鸿沟。

关键词

引用

@article{arxiv.2507.05966,
  title  = {Simple Convergence Proof of Adam From a Sign-like Descent Perspective},
  author = {Hanyang Peng and Shuang Qin and Yue Yu and Fangqing Jiang and Hui Wang and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2507.05966},
  year   = {2025}
}

备注

23 pages, 2figures