中文

从理论视角理解为何 SGD 在深度学习中泛化优于 ADAM

机器学习 2021-11-30 v2 人工智能 最优化与控制 机器学习

摘要

尽管 ADAM 类自适应梯度算法训练速度更快,但其泛化性能为何不如 SGD 仍不清楚。本文旨在通过剖析它们的局部收敛行为来阐释这一泛化差距。具体而言,我们观察到这些算法中梯度噪声的重尾现象。这促使我们通过其 Levy 驱动的随机微分方程(SDEs)来分析这些算法,因为算法与其 SDE 具有相似的收敛行为。随后我们建立了这些 SDE 从局部势阱中逃逸的时间。结果表明:(1)SGD 与 ADAM 的逃逸时间均正依赖于势阱的 Radon 测度,负依赖于梯度噪声的重尾程度;(2)对于同一势阱,SGD 的逃逸时间小于 ADAM,主要因为(a)ADAM 中通过自适应缩放各梯度坐标的几何自适应很好地削弱了梯度噪声的各向异性结构,导致势阱的 Radon 测度更大;(b)ADAM 中的指数梯度平均平滑了其梯度,使得梯度噪声尾比 SGD 更轻。因此,在尖锐极小值(即局部势阱具有较小 Radon 测度的极小值)处,SGD 比 ADAM 具有更强的局部不稳定性,并能更好地从中逃逸到具有更大 Radon 测度的更平坦极小值。由于此处平坦极小值(常指位于平坦或非对称势阱/谷的极小值)通常比较尖锐极小值泛化更好,我们的结果解释了 SGD 优于 ADAM 的泛化性能。最后,实验结果证实了我们的重尾梯度噪声假设与理论论断。

关键词

引用

@article{arxiv.2010.05627,
  title  = {Towards Theoretically Understanding Why SGD Generalizes Better Than ADAM in Deep Learning},
  author = {Pan Zhou and Jiashi Feng and Chao Ma and Caiming Xiong and Steven Hoi and Weinan E},
  journal= {arXiv preprint arXiv:2010.05627},
  year   = {2021}
}

备注

NeurIPS 2020