中文

训练更久,泛化更好:弥合神经网络大批量训练中的泛化鸿沟

机器学习 2018-01-03 v2 机器学习

摘要

背景:深度学习模型通常使用随机梯度下降或其变体进行训练。这些方法利用从一小部分训练数据估计的梯度来更新权重。已有观察表明,当使用大批量大小训练时,泛化性能会出现持续退化——这被称为“泛化鸿沟”现象。确定这一鸿沟的根源并加以弥合一直是一个开放问题。贡献:我们研究了初始高学习率训练阶段。我们发现权重与其初始化点之间的距离随权重更新次数呈对数增长。因此,我们提出了一个“随机景观上的随机游走”统计模型,已知该模型表现出类似的“超慢”扩散行为。基于这一假设,我们进行了实验,从经验上证明“泛化鸿沟”源于相对较少的更新次数而非批量大小,并且可以通过调整所用的训练机制来完全消除。我们进一步研究了在大批量机制下训练模型的不同技术,并提出了一种名为“Ghost Batch Normalization”的新算法,该算法能够在不增加更新次数的情况下显著减小泛化鸿沟。为了验证我们的发现,我们在 MNIST、CIFAR-10、CIFAR-100 和 ImageNet 上进行了若干额外实验。最后,我们重新评估了关于深度模型训练的常见做法与信念,并指出它们可能并非实现良好泛化的最优选择。

关键词

引用

@article{arxiv.1705.08741,
  title  = {Train longer, generalize better: closing the generalization gap in large batch training of neural networks},
  author = {Elad Hoffer and Itay Hubara and Daniel Soudry},
  journal= {arXiv preprint arXiv:1705.08741},
  year   = {2018}
}