中文

重新思考批归一化与 Dropout 在深度神经网络训练中的使用

机器学习 2019-05-16 v1 机器学习

摘要

在这项工作中,我们提出了一种新技术以提升神经网络的训练效率。我们的工作基于一个出色的想法,即白化神经网络的输入可以实现快速的收敛速度。鉴于独立分量必须被白化这一众所周知的事实,我们在每个权重层之前引入了一种新颖的独立分量(IC)层,其输入将变得更加独立。然而,确定独立分量是一项计算密集的任务。为克服这一挑战,我们提出通过以一种新的方式结合两种流行技术——批归一化(Batch Normalization)和 Dropout——来实现 IC 层,我们可以严格证明 Dropout 能相对于 dropout 层参数 pp 二次地减少互信息并线性地减少任意一对神经元之间的相关性。如实验所示,IC 层在 CIFAR10/100 和 ILSVRC2012 数据集上始终以更稳定的训练过程、更快的收敛速度和更好的收敛极限优于基线方法。我们 IC 层的实现使我们重新思考神经网络设计中的常见做法。例如,我们不应将批归一化置于 ReLU 之前,因为 ReLU 的非负响应会使权重层以次优方式更新,并且我们可以通过将批归一化和 Dropout 组合为一个 IC 层来获得更好的性能。

关键词

引用

@article{arxiv.1905.05928,
  title  = {Rethinking the Usage of Batch Normalization and Dropout in the Training of Deep Neural Networks},
  author = {Guangyong Chen and Pengfei Chen and Yujun Shi and Chang-Yu Hsieh and Benben Liao and Shengyu Zhang},
  journal= {arXiv preprint arXiv:1905.05928},
  year   = {2019}
}

备注

Correspondence to:Benben Liao <[email protected]>