具有非线性共轭梯度式自适应动量的随机梯度下降
机器学习
2020-12-04 v1 数值分析
数值分析
最优化与控制
摘要
动量在基于随机梯度的优化算法中对于加速或改进深度神经网络(DNN)训练起着关键作用。在深度学习实践中,动量通常由校准良好的常数加权。然而,为动量调超参数可能是显著的计算负担。本文中,我们提出一种用于改进 DNN 训练的新型\emph{自适应动量};该自适应动量无需动量相关超参数,其动机来自非线性共轭梯度(NCG)方法。带有此新自适应动量的随机梯度下降(SGD)消除了动量超参数校准的需要,允许显著更大的学习率,加速 DNN 训练,并改善训练后 DNN 的最终精度与鲁棒性。例如,带此自适应动量的 SGD 将训练 ResNet110 在 CIFAR10 与 CIFAR100 上的分类错误分别从 降至 以及从 降至 。此外,带新自适应动量的 SGD 也有利于对抗训练并改善训练后 DNN 的对抗鲁棒性。
引用
@article{arxiv.2012.02188,
title = {Stochastic Gradient Descent with Nonlinear Conjugate Gradient-Style Adaptive Momentum},
author = {Bao Wang and Qiang Ye},
journal= {arXiv preprint arXiv:2012.02188},
year = {2020}
}
备注
17 pages, 2 figures