中文

具有非线性共轭梯度式自适应动量的随机梯度下降

机器学习 2020-12-04 v1 数值分析 数值分析 最优化与控制

摘要

动量在基于随机梯度的优化算法中对于加速或改进深度神经网络(DNN)训练起着关键作用。在深度学习实践中,动量通常由校准良好的常数加权。然而,为动量调超参数可能是显著的计算负担。本文中,我们提出一种用于改进 DNN 训练的新型\emph{自适应动量};该自适应动量无需动量相关超参数,其动机来自非线性共轭梯度(NCG)方法。带有此新自适应动量的随机梯度下降(SGD)消除了动量超参数校准的需要,允许显著更大的学习率,加速 DNN 训练,并改善训练后 DNN 的最终精度与鲁棒性。例如,带此自适应动量的 SGD 将训练 ResNet110 在 CIFAR10 与 CIFAR100 上的分类错误分别从 5.25%5.25\% 降至 4.64%4.64\% 以及从 23.75%23.75\% 降至 20.03%20.03\%。此外,带新自适应动量的 SGD 也有利于对抗训练并改善训练后 DNN 的对抗鲁棒性。

关键词

引用

@article{arxiv.2012.02188,
  title  = {Stochastic Gradient Descent with Nonlinear Conjugate Gradient-Style Adaptive Momentum},
  author = {Bao Wang and Qiang Ye},
  journal= {arXiv preprint arXiv:2012.02188},
  year   = {2020}
}

备注

17 pages, 2 figures