中文

更宽还是更深:重新审视用于视觉识别的ResNet模型

计算机视觉与模式识别 2016-12-01 v1

摘要

深度神经网络日益加深的趋势,是由一个普遍观察所驱动的,即增加深度会提升网络性能。然而,最近越来越多的证据表明,简单地增加深度可能并非提升性能的最佳方式,尤其是在考虑到其他限制因素时。对深度残差网络的研究也表明,它们实际上可能并非作为一个单一的深层网络运行,而是作为许多相对较浅网络的集成。我们审视了这些问题,并在此过程中对深度残差网络的“拆解”视图得出了一种新的解释,该解释说明了实验观察到的一些行为。由此,我们能够推导出一种新的、更浅的残差网络架构,该架构在ImageNet分类数据集上显著优于诸如ResNet-200等更深的模型。我们还通过开发一种语义分割方法,展示了这种性能可迁移到其他问题领域,该方法在包括PASCAL VOC、PASCAL Context和Cityscapes在内的数据集上,以显著的优势超越了最先进的技术。因此,我们提出的架构在性能上优于其比较对象(包括非常深的ResNet),同时在内存使用上更高效,有时在训练时间上也更高效。代码和模型可在 https://github.com/itijyou/ademxapp 获取。

关键词

引用

@article{arxiv.1611.10080,
  title  = {Wider or Deeper: Revisiting the ResNet Model for Visual Recognition},
  author = {Zifeng Wu and Chunhua Shen and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1611.10080},
  year   = {2016}
}

备注

Code available at: https://github.com/itijyou/ademxapp