中文

理解基于随机梯度的 Adam 在学习神经网络中的泛化

机器学习 2025-10-14 v1 人工智能 机器学习

摘要

Adam 是一种流行且广泛使用的自适应梯度方法,在深度学习中得到了广泛应用,也受到大量理论研究的关注。然而,大多数现有理论工作主要分析其全批次版本,这与实际应用中的随机变体存在根本差异。与 SGD 不同,随机 Adam 即使在学习率趋于零时,也不会收敛到其全批次版本。我们对 batch size 对 Adam 泛化性质的首个理论刻画,分析了在图像数据上的两层过参数化 CNN。我们的结果表明,尽管 Adam 和带适当权重衰减 λ\lambda 的 AdamW 都收敛到性能较差的测试误差解,但它们的 mini-batch 变体可实现接近零的测试误差。我们进一步证明,Adam 的有效权重衰减上界严格小于 AdamW,这从理论上解释了为何 Adam 需要更敏感的 λ\lambda 调参。大量实验验证了我们的发现,表明 batch size 和权重衰减在 Adam 的泛化性能中发挥着关键作用。

关键词

引用

@article{arxiv.2510.11354,
  title  = {Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks},
  author = {Xuan Tang and Han Zhang and Yuan Cao and Difan Zou},
  journal= {arXiv preprint arXiv:2510.11354},
  year   = {2025}
}

备注

71 pages, 12 figures, NeurIPS 2025