中文

用于加速随机梯度下降的预定重启动量

机器学习 2020-04-28 v2 神经与进化计算 机器学习

摘要

具有恒定动量的随机梯度下降(SGD)及其变体如 Adam 是训练深度神经网络(DNNs)的首选优化算法。由于 DNN 训练计算开销极大,加速收敛备受关注。Nesterov 加速梯度(NAG)利用专门设计的动量改善了梯度下降(GD)在凸优化中的收敛率;然而,当使用不精确梯度(如 SGD 中)时它会累积误差,最好减慢收敛,最坏导致发散。本文提出 Scheduled Restart SGD(SRSGD),一种用于训练 DNN 的新型 NAG 风格方案。SRSGD 将 SGD 中的恒定动量替换为 NAG 中的递增动量,并按计划将动量重置为零以稳定迭代。利用多种模型和图像分类基准,我们证明在训练 DNN 时 SRSGD 显著改善收敛与泛化;例如在训练 ResNet200 进行 ImageNet 分类时,SRSGD 达到 20.93% 的错误率,而基准为 22.13%。这些改进随网络加深而更显著。此外,在 CIFAR 和 ImageNet 上,与 SGD 基线相比,SRSGD 以显著更少的训练轮数达到相似甚至更优的错误率。

关键词

引用

@article{arxiv.2002.10583,
  title  = {Scheduled Restart Momentum for Accelerated Stochastic Gradient Descent},
  author = {Bao Wang and Tan M. Nguyen and Andrea L. Bertozzi and Richard G. Baraniuk and Stanley J. Osher},
  journal= {arXiv preprint arXiv:2002.10583},
  year   = {2020}
}

备注

35 pages, 16 figures, 18 tables