中文

批归一化:通过减少内部协变量偏移加速深度网络训练

机器学习 2015-03-03 v3

摘要

训练深度神经网络变得复杂,原因在于随着前层参数的变化,每一层输入的分布会在训练过程中发生变化。这导致需要更低的学习率和谨慎的参数初始化,从而减慢了训练速度,并使得训练具有饱和非线性的模型变得 notoriously 困难。我们将这种现象称为内部协变量偏移,并通过归一化层输入来解决该问题。我们的方法的优势在于将归一化作为模型架构的一部分,并对每个训练小批量执行归一化。批归一化允许我们使用更高的学习率,并降低对初始化的敏感度。它还起到正则化的作用,在某些情况下消除了对 Dropout 的需求。应用于最先进的图像分类模型时,批归一化以少 14 倍的训练步数达到了相同的准确率,并以显著优势超越了原始模型。通过使用批归一化网络的集成,我们改进了 ImageNet 分类的最佳已发表结果:达到了 4.9% 的 top-5 验证误差(以及 4.8% 的测试误差),超过了人类评估者的准确率。

关键词

引用

@article{arxiv.1502.03167,
  title  = {Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift},
  author = {Sergey Ioffe and Christian Szegedy},
  journal= {arXiv preprint arXiv:1502.03167},
  year   = {2015}
}