中文

超收敛:利用大学习率极速训练神经网络

机器学习 2018-05-18 v3 计算机视觉与模式识别 神经与进化计算 机器学习

摘要

在本文中,我们描述了一种名为“超收敛”的现象,即神经网络的训练速度可比标准训练方法快一个数量级。超收敛的存在与理解深度网络为何具有良好的泛化能力相关。超收敛的关键要素之一是使用单个学习率周期和较大的最大学习率进行训练。实现超收敛训练的一个主要见解是,大学习率具有正则化作用,因此需要减少所有其他形式的正则化以保持最佳的正则化平衡。我们还推导了 Hessian Free 优化方法的简化形式,以计算最优学习率的估计值。实验证明了在 Cifar-10/100、MNIST 和 Imagenet 数据集上,以及 resnet、wide-resnet、densenet 和 inception 架构上的超收敛现象。此外,我们表明当标记训练数据量有限时,超收敛相比标准训练能提供更大的性能提升。复现本文图表所需的架构和代码可在 github.com/lnsmith54/super-convergence 获取。关于超收敛在赢得 DAWNBench 挑战中的应用,参见 http://www.fast.ai/2018/04/30/dawnbench-fastai/ (见 https://dawn.cs.stanford.edu/benchmark/)。

关键词

引用

@article{arxiv.1708.07120,
  title  = {Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates},
  author = {Leslie N. Smith and Nicholay Topin},
  journal= {arXiv preprint arXiv:1708.07120},
  year   = {2018}
}

备注

This paper was significantly revised to show super-convergence as a general fast training methodology