缩小自适应梯度方法训练深度神经网络中的泛化差距
机器学习
2020-06-24 v3 机器学习
摘要
自适应梯度方法利用历史梯度信息自动调整学习率,尽管具有快速收敛的良好性质,但被观察到在训练深度神经网络时泛化能力差于带动量的随机梯度下降(SGD)。这使得如何缩小自适应梯度方法的泛化差距成为一个开放问题。在本工作中,我们表明 Adam、Amsgrad 等自适应梯度方法有时“过度自适应”。我们设计了一种称为部分自适应动量估计方法的新算法,通过引入部分自适应参数 将 Adam/Amsgrad 与 SGD 统一,以兼得两者之长。我们还证明了所提算法在随机非凸优化设定下收敛到驻点的收敛速率。在标准基准上的实验表明,所提算法能保持 Adam/Amsgrad 般的快速收敛速率,同时在训练深度神经网络时泛化能力与 SGD 相当。这些结果将提示实践者再次选用自适应梯度方法以更快训练深度神经网络。
引用
@article{arxiv.1806.06763,
title = {Closing the Generalization Gap of Adaptive Gradient Methods in Training Deep Neural Networks},
author = {Jinghui Chen and Dongruo Zhou and Yiqi Tang and Ziyan Yang and Yuan Cao and Quanquan Gu},
journal= {arXiv preprint arXiv:1806.06763},
year = {2020}
}
备注
17 pages, 4 figures, 4 tables. In IJCAI 2020