中文

采用合并-运行映射的深度卷积神经网络

计算机视觉与模式识别 2017-07-20 v2

摘要

由一系列残差块堆叠而成的深度残差网络易于训练,因为恒等映射跳过了残差分支,从而改善了信息流动。为进一步降低训练难度,我们提出一种简单的网络架构——深度合并-运行神经网络。其新颖之处在于一个模块化的构建块,即合并-运行块,它通过合并-运行映射将残差分支并行组合:取这些残差分支输入的平均值(合并),并将该平均值分别加到每个残差分支的输出上,作为后续残差分支的输入(运行)。我们证明,合并-运行映射是一种线性幂等函数,其变换矩阵是幂等的,因此改善了信息流动,使训练变得容易。与残差网络相比,我们的网络具有显著优势:它们包含更短的路径,且宽度(即通道数)有所增加。我们在标准识别任务上评估了性能。在可比设置下,我们的方法相比ResNets表现出一致的改进,并取得了有竞争力的结果(例如,CIFAR-10上测试误差为3.57%3.57\%,CIFAR-100上为19.00%19.00\%,SVHN上为1.51%1.51\%)。

关键词

引用

@article{arxiv.1611.07718,
  title  = {Deep Convolutional Neural Networks with Merge-and-Run Mappings},
  author = {Liming Zhao and Jingdong Wang and Xi Li and Zhuowen Tu and Wenjun Zeng},
  journal= {arXiv preprint arXiv:1611.07718},
  year   = {2017}
}