中文

Conv2Former:一种用于视觉识别的简洁Transformer风格卷积网络

计算机视觉与模式识别 2022-11-23 v1

摘要

本文并非试图设计一种用于视觉识别的最先进方法,而是探究一种更高效地利用卷积来编码空间特征的方式。通过比较近期卷积神经网络(ConvNets)与视觉Transformer的设计原则,我们提出通过利用卷积调制操作来简化自注意力机制。我们表明,这种简单的方法能够更好地发挥嵌套在卷积层中的大卷积核(>=7x7)的优势。我们利用所提出的卷积调制构建了一系列分层卷积网络,称为Conv2Former。我们的网络简洁且易于复现。实验表明,在ImageNet分类、COCO目标检测和ADE20k语义分割任务中,我们的Conv2Former优于现有的流行卷积网络与视觉Transformer,如Swin Transformer和ConvNeXt。

关键词

引用

@article{arxiv.2211.11943,
  title  = {Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition},
  author = {Qibin Hou and Cheng-Ze Lu and Ming-Ming Cheng and Jiashi Feng},
  journal= {arXiv preprint arXiv:2211.11943},
  year   = {2022}
}