中文

Involution:反转卷积的固有特性用于视觉识别

计算机视觉与模式识别 2021-04-13 v2

摘要

卷积已成为现代神经网络的核心要素,引发了视觉深度学习的浪潮。本工作中,我们反思标准卷积用于视觉任务的固有原理,具体而言即空间无关性与通道特异性。相反,我们通过反转上述卷积设计原理,提出一种用于深度神经网络的新原子操作,称为 involution。我们进一步揭开了近期流行的自注意力算子的神秘面纱,并将其归为我们的 involution 族中一种过度复杂的实例化。所提 involution 算子可作为基础构件用于构建新一代视觉识别神经网络,在若干主流基准上赋能不同深度学习模型,包括 ImageNet 分类、COCO 检测与分割,以及 Cityscapes 分割。我们基于 involution 的模型在以上基准上分别将使用 ResNet-50 的卷积基线性能提升绝对 1.6% top-1 准确率、2.5% 与 2.4% 边界框 AP,以及 4.7% 平均 IoU,同时将计算成本压缩至 66%、65%、72% 与 57%。所有任务的代码与预训练模型可在 https://github.com/d-li14/involution 获取。

关键词

引用

@article{arxiv.2103.06255,
  title  = {Involution: Inverting the Inherence of Convolution for Visual Recognition},
  author = {Duo Li and Jie Hu and Changhu Wang and Xiangtai Li and Qi She and Lei Zhu and Tong Zhang and Qifeng Chen},
  journal= {arXiv preprint arXiv:2103.06255},
  year   = {2021}
}

备注

Accepted to CVPR 2021. Code and models are available at https://github.com/d-li14/involution