理解带有适当正则化的神经网络学习中 Adam 的泛化
机器学习
2021-08-26 v1 最优化与控制
机器学习
摘要
诸如 Adam 之类的自适应梯度方法在深度学习优化中获得了越来越多的关注。然而,人们观察到,在图像分类等许多深度学习应用中,与(随机)梯度下降相比,即使经过微调的正则化,Adam 也会收敛到具有显著更差测试误差的不同解。在本文中,我们为这一现象提供了理论解释:我们表明,在从相同随机初始化开始学习过参数化双层卷积神经网络的非凸设置中,对于一类数据分布(受图像数据启发),Adam 和梯度下降 (GD) 会收敛到训练目标的不同全局解,且具有可证明的不同泛化误差,即使采用了权重衰减正则化。相比之下,我们表明如果训练目标是凸的,并且采用了权重衰减正则化,那么包括 Adam 和 GD 在内的任何优化算法,只要训练成功,都将收敛到相同的解。这表明 Adam 较差的泛化性能从根本上与深度学习优化的非凸景观有关。
引用
@article{arxiv.2108.11371,
title = {Understanding the Generalization of Adam in Learning Neural Networks with Proper Regularization},
author = {Difan Zou and Yuan Cao and Yuanzhi Li and Quanquan Gu},
journal= {arXiv preprint arXiv:2108.11371},
year = {2021}
}
备注
42 pages, 2 figures and 1 table