自适应惯性:解耦自适应学习率与动量的效应
机器学习
2022-06-15 v9 机器学习
摘要
自适应矩估计(Adam)结合了自适应学习率与动量,是加速深度神经网络训练最为流行的随机优化器。然而,经验上已知 Adam 的泛化性能常劣于随机梯度下降(SGD)。本文旨在扩散理论框架下揭示此现象之谜。具体而言,我们解耦了 Adam 动力学中自适应学习率与动量对鞍点逃逸和平坦极小值选择的影响。我们证明自适应学习率能高效逃逸鞍点,但不能像 SGD 那样选择平坦极小值。相反,动量提供一种漂移效应以帮助训练过程穿过鞍点,且几乎不影响平坦极小值的选择。这在一定程度上解释了为何 SGD(带动量)泛化更好,而 Adam 泛化更差但收敛更快。此外,受该分析启发,我们设计了一种名为自适应惯性(Adaptive Inertia)的新型自适应优化框架,它使用逐参数的自适应惯性来加速训练,并可证明像 SGD 一样偏好平坦极小值。我们大量的实验表明,所提出的自适应惯性方法泛化性能显著优于 SGD 和常规自适应梯度方法。
引用
@article{arxiv.2006.15815,
title = {Adaptive Inertia: Disentangling the Effects of Adaptive Learning Rate and Momentum},
author = {Zeke Xie and Xinrui Wang and Huishuai Zhang and Issei Sato and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2006.15815},
year = {2022}
}
备注
ICML2022, Long Oral Presentation, 30 pages, 14 figures, Key Words: Deep Learning Theory, Optimization, Adam, Adaptive Inertia, Flat Minima