HomeAdam: Adam 与 AdamW 算法时常返回以获得更可证明的泛化性能
机器学习
2026-03-04 v1 最优化与控制
机器学习
摘要
Adam 和 AdamW 是机器学习中训练深度学习模型的默认优化器。这类自适应算法收敛速度更快,但泛化性能较差。事实上,它们的已证明泛化误差为 ,也比 SGD 的 大,其中 表示训练样本大小。最近,尽管一些 Adam 的变体被提出以改善其泛化性,但其改进后的泛化性在理论上仍未得到探讨。为填补这一空白,本文通过算法稳定性重新研究 Adam 和 AdamW 的泛化性,首次证明无平方根项的 Adam 和 AdamW(即 Adam(W)-srf)具有泛化误差 ,其中 表示迭代次数, 表示二阶动量中最小元素加上一个小正数。为改善泛化性,我们提出了一类高效巧妙的 Adam(即 HomeAdam(W))算法,通过时常返回基于动量的 SGD。我们证明,HomeAdam(W) 的泛化误差为 ,小于 Adam(W)-srf 的 ,因为 通常非常小。特别是,它也小于现有的 Adam(W) 的 。同时,我们证明 HomeAdam(W) 的收敛速率为 ,优于 Adam(W)-srf 的 ,其中 也非常小。大量数值实验表明我们 HomeAdam(W) 算法的有效性。
引用
@article{arxiv.2603.02649,
title = {HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization},
author = {Feihu Huang and Guanyi Zhang and Songcan Chen},
journal= {arXiv preprint arXiv:2603.02649},
year = {2026}
}
备注
39 pages