中文

CMT:卷积神经网络遇见视觉Transformer

计算机视觉与模式识别 2022-06-15 v3

摘要

视觉transformers已成功应用于图像识别任务,因其能捕获图像内的长程依赖。然而,在性能与计算成本上,transformers与现有卷积神经网络(CNNs)之间仍存在差距。本文旨在解决该问题,并开发一种网络,其不仅优于经典transformers,也优于高性能卷积模型。我们通过利用transformers捕获长程依赖、利用CNNs建模局部特征,提出了一种基于transformer的新型混合网络。此外,我们对其缩放得到一系列称为CMTs的模型,获得了比先前卷积与基于transformer的模型好得多的精度与效率。特别地,我们的CMT-S在ImageNet上达到83.5%的top-1精度,同时在FLOPs上比现有DeiT和EfficientNet分别小14倍和2倍。所提CMT-S在CIFAR10(99.2%)、CIFAR100(91.7%)、Flowers(98.7%)及其他具挑战性视觉数据集如COCO(44.3% mAP)上也有良好泛化,且计算成本显著降低。

关键词

引用

@article{arxiv.2107.06263,
  title  = {CMT: Convolutional Neural Networks Meet Vision Transformers},
  author = {Jianyuan Guo and Kai Han and Han Wu and Yehui Tang and Xinghao Chen and Yunhe Wang and Chang Xu},
  journal= {arXiv preprint arXiv:2107.06263},
  year   = {2022}
}

备注

Accepted in CVPR 2022