中文

深度卷积神经网络中高效且有效的Dropout方法

机器学习 2020-07-29 v5 计算机视觉与模式识别

摘要

基于卷积神经网络(CNN)的应用已无处不在,其中亟需适当的正则化。为防止大型神经网络模型过拟合,dropout已被广泛用作一种高效的正则化技术。然而,许多近期研究表明,标准dropout对CNN的训练无效甚至有害。本文重新审视该问题,并考察多种dropout变体,试图改进现有的基于dropout的CNN正则化技术。我们将标准dropout的失败归因于dropout的随机性与其后续的批归一化(Batch Normalization, BN)之间的冲突,并提出通过将dropout操作置于卷积操作之前而非BN之前来减少冲突,或通过用组归一化(Group Normalization, GN)替换BN来彻底解决该问题。我们进一步引入一种结构上更适配的dropout变体Drop-Conv2d,其为深度CNN提供更高效且有效的正则化。这些dropout变体可轻松集成到CNN的基本构建块中,并在现有深度学习平台上实现。在包括CIFAR、SVHN和ImageNet在内的基准数据集上进行了大量实验,以比较现有构建块与所提出的带dropout训练的构建块。结果表明,我们的构建块显著优于最先进的CNN,这主要得益于更好的正则化和隐式模型集成效应。

关键词

引用

@article{arxiv.1904.03392,
  title  = {Effective and Efficient Dropout for Deep Convolutional Neural Networks},
  author = {Shaofeng Cai and Yao Shu and Gang Chen and Beng Chin Ooi and Wei Wang and Meihui Zhang},
  journal= {arXiv preprint arXiv:1904.03392},
  year   = {2020}
}

备注

12 pages, 10 figures