用于图像与视频识别的改进残差网络
计算机视觉与模式识别
2020-04-13 v1
摘要
残差网络 (ResNets) 代表一种强大的卷积神经网络 (CNN) 架构类型,被广泛采用并用于各类任务。在本文中,我们提出 ResNets 的改进版本。我们所提出的改进涉及 ResNet 的三个主要组件:通过网络层的信息流、残差构建块以及投影捷径。我们能够展示在准确率和学习收敛性上相对于基线的一致提升。例如,在 ImageNet 数据集上,使用 50 层 ResNet,在 top-1 准确率方面,我们能在一种设置下报告比基线提升 1.19%,在另一种设置下提升约 2%。重要的是,这些改进是在不增加模型复杂度的前提下获得的。我们提出的方法允许我们训练极深网络,而基线在这些极端深度下表现出严重的优化问题。我们报告了在六个数据集上的三个任务的结果:图像分类 (ImageNet、CIFAR-10 和 CIFAR-100)、目标检测 (COCO) 和视频动作识别 (Kinetics-400 和 Something-Something-v2)。在深度学习时代,我们为 CNN 的深度确立了新里程碑。我们成功在 ImageNet 数据集上训练了 404 层深 CNN,在 CIFAR-10 和 CIFAR-100 上训练了 3002 层网络,而基线无法在此类极端深度下收敛。代码见:https://github.com/iduta/iresnet
引用
@article{arxiv.2004.04989,
title = {Improved Residual Networks for Image and Video Recognition},
author = {Ionut Cosmin Duta and Li Liu and Fan Zhu and Ling Shao},
journal= {arXiv preprint arXiv:2004.04989},
year = {2020}
}