中文

Adam 无需修改更新规则即可收敛

机器学习 2023-01-16 v5 最优化与控制

摘要

自 Reddi 等人于 2018 年指出 Adam 的发散问题以来,许多新变体被设计出来以获得收敛性。然而,原始 Adam 仍然异常流行,并且在实践中表现良好。为何理论与实践之间存在鸿沟?我们指出理论与实践的设定存在错配:Reddi 等人 2018 年在选定 Adam 的超参数(即 (β1,β2)(\beta_1, \beta_2))之后才选取问题;而实际应用通常先固定问题,再调整 (β1,β2)(\beta_1, \beta_2)。基于这一观察,我们猜想,只有改变选取问题与超参数的顺序,经验收敛性才能在理论上得到证明。本文中,我们证实了这一猜想。我们证明,当 β2\beta_2 较大且 β1<β2<1\beta_1 < \sqrt{\beta_2}<1 时,Adam 收敛到临界点邻域。该邻域的大小与随机梯度方差成正比。在额外条件(强增长条件)下,Adam 收敛到临界点。值得指出的是,我们的结果覆盖了广泛的超参数范围:随着 β2\beta_2 增大,我们的收敛结果可覆盖任意 β1[0,1)\beta_1 \in [0,1),包括 β1=0.9\beta_1=0.9,这是深度学习库中的默认设置。据我们所知,这是首个表明 Adam 无需对其更新规则做任何修改即可收敛的结果。此外,我们的分析不要求有界梯度或有界二阶动量的假设。当 β2\beta_2 较小时,我们进一步指出一片较大的 (β1,β2)(\beta_1,\beta_2) 区域,其中 Adam 可发散至无穷。我们的发散结果考虑了与收敛结果相同的设定,表明随着 β2\beta_2 增大存在从发散到收敛的相变。这些正面与负面结果可为如何调整 Adam 超参数提供建议。

关键词

引用

@article{arxiv.2208.09632,
  title  = {Adam Can Converge Without Any Modification On Update Rules},
  author = {Yushun Zhang and Congliang Chen and Naichen Shi and Ruoyu Sun and Zhi-Quan Luo},
  journal= {arXiv preprint arXiv:2208.09632},
  year   = {2023}
}

备注

68 pages