中文

批归一化如何增加崩溃的神经网络滤波器?

机器学习 2020-02-03 v2 机器学习

摘要

提高深度神经网络(DNNs)的稀疏性对于网络压缩至关重要,并已引起广泛关注。在本工作中,我们揭示了一种称为滤波器崩溃的有害稀疏化过程,它在带有批归一化(BN)和修正线性激活函数(如 ReLU、Leaky ReLU)的 DNNs 中十分常见。即使没有诸如 L1L_1 之类的显式稀疏诱导正则化,它也会发生。该现象由 BN 的归一化效应引起,其在参数空间中诱导出一个不可训练区域,并由此降低网络容量。当网络以较大学习率(LR)或自适应 LR 调度器训练,以及当网络被微调时,该现象变得更加显著。我们分析证明了 BN 的参数在高梯度噪声的 SGD 更新过程中趋于变得更稀疏,且稀疏化概率与学习率的平方成正比,与 BN 尺度参数的平方成反比。为防止不良的崩溃滤波器,我们提出了一种简单而有效的方法,称为后偏移 BN(psBN),它与 BN 具有相同的表示能力,同时能够在 BN 参数于训练期间饱和时自动使其重新可训练。借助 psBN,我们可以在 CIFAR-10 上的分类和 MS-COCO2017 上的目标检测等多种任务中恢复崩溃的滤波器并提升模型性能。

关键词

引用

@article{arxiv.2001.11216,
  title  = {How Does BN Increase Collapsed Neural Network Filters?},
  author = {Sheng Zhou and Xinjiang Wang and Ping Luo and Litong Feng and Wenjie Li and Wei Zhang},
  journal= {arXiv preprint arXiv:2001.11216},
  year   = {2020}
}