中文

不要衰减学习率,增大批量大小

机器学习 2018-02-27 v2 计算机视觉与模式识别 分布式、并行与集群计算 机器学习

摘要

衰减学习率是常见做法。本文中我们表明,通常在训练过程中通过增大批量大小亦可获得在训练集与测试集上相同的学习曲线。该过程对随机梯度下降(SGD)、带动量的SGD、Nesterov动量以及Adam均有效。它在相同训练轮数后达到同等的测试准确率,但参数更新更少,从而带来更强的并行性与更短的训练时间。我们可通过增大学习率 ϵ\epsilon 并缩放批量大小 BϵB \propto \epsilon 来进一步减少参数更新次数。最后,可增大动量系数 mm 并缩放 B1/(1m)B \propto 1/(1-m),尽管这往往略微降低测试准确率。关键在于,我们的技术使我们能够重新利用现有训练调度方案进行大批量训练而无需超参数调优。我们在 ImageNet 上以不到30分钟训练 ResNet-50 达到 76.1%76.1\% 验证准确率。

关键词

引用

@article{arxiv.1711.00489,
  title  = {Don't Decay the Learning Rate, Increase the Batch Size},
  author = {Samuel L. Smith and Pieter-Jan Kindermans and Chris Ying and Quoc V. Le},
  journal= {arXiv preprint arXiv:1711.00489},
  year   = {2018}
}

备注

11 pages, 8 figures. Published as a conference paper at ICLR 2018