中文

Adam 在更新规则上无需任何修改即可收敛

机器学习 2026-03-03 v1 最优化与控制

摘要

Adam是训练神经网络,包括大型语言模型(LLM)的默认算法。然而,\citet{reddi2019convergence}提供了一个示例表明Adam会发散,引发人们对其在AI模型训练中部署的担忧。我们识别出发散示例与实际应用之间的关键不匹配:\citet{reddi2019convergence}在选择Adam的超参数(\beta_1,\beta_2)后才选择问题;而实际应用通常先固定问题,再调谋(\beta_1,\beta_2)。在本文中,我们证明了在恰当的问题依赖超参数下,Adam是收敛的。首先,我们证明了当\beta_2较大且\beta_1<\sqrt{\beta_2}时,Adam收敛。其次,当\beta_2较小时,我们指出了一组(\beta_1,\beta_2)组合可导致Adam发散到无穷。我们的结果表明,Adam在(\beta_1,\beta_2)组合的变化下从发散转为收敛之间存在相位转变。据我们了解,这是文献中首次报告的(\beta_1,\beta_2)二维平面上的相位转变,为Adam优化器提供了严格的理论保证。我们进一步指出,关键边界(\beta_1^*, \beta_2^*)是问题依赖的,特别是取决于批量大小。这提供了调整\beta_1和\beta_2的建议:当Adam工作不佳时,建议按批量大小的反比例调高\beta_2以超过阈值\beta_2^*,然后尝试\beta_1<\sqrt{\beta_2}。我们的建议得到了来自几个经验研究的支持,这些研究观察到在应用这些方法后,LLM训练性能得到改善。

关键词

引用

@article{arxiv.2603.02092,
  title  = {Adam Converges Without Any Modification On Update Rules},
  author = {Yushun Zhang and Bingran Li and Congliang Chen and Zhi-Quan Luo and Ruoyu Sun},
  journal= {arXiv preprint arXiv:2603.02092},
  year   = {2026}
}

备注

66 pages