采用合并-运行映射的深度卷积神经网络
计算机视觉与模式识别
2017-07-20 v2
摘要
由一系列残差块堆叠而成的深度残差网络易于训练,因为恒等映射跳过了残差分支,从而改善了信息流动。为进一步降低训练难度,我们提出一种简单的网络架构——深度合并-运行神经网络。其新颖之处在于一个模块化的构建块,即合并-运行块,它通过合并-运行映射将残差分支并行组合:取这些残差分支输入的平均值(合并),并将该平均值分别加到每个残差分支的输出上,作为后续残差分支的输入(运行)。我们证明,合并-运行映射是一种线性幂等函数,其变换矩阵是幂等的,因此改善了信息流动,使训练变得容易。与残差网络相比,我们的网络具有显著优势:它们包含更短的路径,且宽度(即通道数)有所增加。我们在标准识别任务上评估了性能。在可比设置下,我们的方法相比ResNets表现出一致的改进,并取得了有竞争力的结果(例如,CIFAR-10上测试误差为,CIFAR-100上为,SVHN上为)。
引用
@article{arxiv.1611.07718,
title = {Deep Convolutional Neural Networks with Merge-and-Run Mappings},
author = {Liming Zhao and Jingdong Wang and Xi Li and Zhuowen Tu and Wenjun Zeng},
journal= {arXiv preprint arXiv:1611.07718},
year = {2017}
}