用于视觉识别的门控通道变换
计算机视觉与模式识别
2020-03-30 v2
摘要
本工作中,我们提出一种普遍适用于深度卷积神经网络视觉识别的变换单元。该变换以可解释的控制变量显式建模通道关系。这些变量决定竞争或合作的神经元行为,并与卷积权重联合优化以实现更精准识别。在Squeeze-and-Excitation(SE)网络中,通道关系由全连接层隐式学习,且SE块集成于块级。我们转而引入通道归一化层以减少参数量与计算复杂度。该轻量层结合简单l2归一化,使我们的变换单元可应用于算子级而无需过多增加额外参数。大量实验以明显优势证明了我们的单元在诸多视觉任务上的有效性,即ImageNet上的图像分类、COCO上的目标检测与实例分割、Kinetics上的视频分类。
引用
@article{arxiv.1909.11519,
title = {Gated Channel Transformation for Visual Recognition},
author = {Zongxin Yang and Linchao Zhu and Yu Wu and Yi Yang},
journal= {arXiv preprint arXiv:1909.11519},
year = {2020}
}
备注
Accepted to CVPR 2020