从符号类下降视角下的 Adam 优化器简单收敛性证明
机器学习
2025-07-10 v1 人工智能
信息论
math.IT
摘要
Adam 被广泛认为是训练深度神经网络(DNN)最有效的优化器之一。尽管其在实践中取得了显著成功,但其理论收敛分析仍不令人满意。现有工作主要将 Adam 解释为带动量的预条件随机梯度下降(SGDM),公式为 。这种视角需要强假设且技术复杂,导致冗长且晦涩的收敛性证明,难以验证和推广。相反,我们提出一种新颖的解释,将 Adam 视为符号类优化器,公式为 。这种改写显著简化了收敛性分析。首次在广义 -仿射方差和 -光滑性弱假设下,我们证明 Adam 实现最优收敛率 ,而非以往在高维模型或数值稳定参数 依赖下的 。此外,我们的理论分析为动量作为收敛关键因素提供新见解,并给出 Adam 学习率调参的实用指导,进一步弥合了理论与实践之间的鸿沟。
引用
@article{arxiv.2507.05966,
title = {Simple Convergence Proof of Adam From a Sign-like Descent Perspective},
author = {Hanyang Peng and Shuang Qin and Yue Yu and Fangqing Jiang and Hui Wang and Zhouchen Lin},
journal= {arXiv preprint arXiv:2507.05966},
year = {2025}
}
备注
23 pages, 2figures