中文

HomeAdam: Adam 与 AdamW 算法时常返回以获得更可证明的泛化性能

机器学习 2026-03-04 v1 最优化与控制 机器学习

摘要

Adam 和 AdamW 是机器学习中训练深度学习模型的默认优化器。这类自适应算法收敛速度更快,但泛化性能较差。事实上,它们的已证明泛化误差为 O(1N)O(\frac{1}{\sqrt{N}}),也比 SGD 的 O(1N)O(\frac{1}{N}) 大,其中 NN 表示训练样本大小。最近,尽管一些 Adam 的变体被提出以改善其泛化性,但其改进后的泛化性在理论上仍未得到探讨。为填补这一空白,本文通过算法稳定性重新研究 Adam 和 AdamW 的泛化性,首次证明无平方根项的 Adam 和 AdamW(即 Adam(W)-srf)具有泛化误差 O(ρ^2TN)O(\frac{\hat{\rho}^{-2T}}{N}),其中 TT 表示迭代次数,ρ^>0\hat{\rho}>0 表示二阶动量中最小元素加上一个小正数。为改善泛化性,我们提出了一类高效巧妙的 Adam(即 HomeAdam(W))算法,通过时常返回基于动量的 SGD。我们证明,HomeAdam(W) 的泛化误差为 O(1N)O(\frac{1}{N}),小于 Adam(W)-srf 的 O(ρ^2TN)O(\frac{\hat{\rho}^{-2T}}{N}),因为 ρ^\hat{\rho} 通常非常小。特别是,它也小于现有的 Adam(W) 的 O(1N)O(\frac{1}{\sqrt{N}})。同时,我们证明 HomeAdam(W) 的收敛速率为 O(1T1/4)O(\frac{1}{T^{1/4}}),优于 Adam(W)-srf 的 O(ρ˘1T1/4)O(\frac{\breve{\rho}^{-1}}{T^{1/4}}),其中 ρ˘ρ^\breve{\rho}\leq\hat{\rho} 也非常小。大量数值实验表明我们 HomeAdam(W) 算法的有效性。

关键词

引用

@article{arxiv.2603.02649,
  title  = {HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization},
  author = {Feihu Huang and Guanyi Zhang and Songcan Chen},
  journal= {arXiv preprint arXiv:2603.02649},
  year   = {2026}
}

备注

39 pages