浅层端:通过辅助输出增强更浅的深度卷积网络
计算机视觉与模式识别
2020-02-18 v6
摘要
深度是卷积神经网络(CNNs)成功的关键因素之一。自 ResNet 以来,由于跳跃连接的引入在很大程度上解决了梯度消失问题,我们能够训练非常深的 CNN。然而,我们观察到,当深度非常大时,中间层(尤其是浅层)可能由于经过长反向传播路径的严重变换而无法从损失中获得足够的监督。结果,中间层的表征能力可能非常弱,模型变得非常冗余且性能有限。在本文中,我们首先研究了现有反向传播(BP)方法中的监督消失问题。然后,我们提出通过一种称为多路 BP(MW-BP)的有效方法来解决该问题,该方法依赖于添加到网络中间层的多个辅助损失。所提出的 MW-BP 方法只需轻微修改即可应用于大多数深度架构,例如 ResNet 和 MobileNet。我们的方法通常产生比现有方法紧凑得多的模型(记为“Mw+架构”)。例如,在 CIFAR-10 和 CIFAR-100 上,具有 44 层的 MwResNet-44 优于具有 110 层的 ResNet-110。更关键的是,所得模型甚至优于通过最先进模型压缩方法获得的轻量模型。最后,我们的方法天然同时产生多个不同深度的紧凑模型,这有助于模型选择。
引用
@article{arxiv.1611.01773,
title = {The Shallow End: Empowering Shallower Deep-Convolutional Networks through Auxiliary Outputs},
author = {Yong Guo and Jian Chen and Qing Du and Anton Van Den Hengel and Qinfeng Shi and Mingkui Tan},
journal= {arXiv preprint arXiv:1611.01773},
year = {2020}
}