中文

Vision Transformers及其CNN-Transformer变体综述

计算机视觉与模式识别 2024-07-30 v4

摘要

Vision Transformers作为卷积神经网络(CNNs)在各种计算机视觉应用中的可能替代品已变得流行。这些Transformer凭借其聚焦图像全局关系的能力,提供了巨大的学习容量。然而,由于它们往往不对图像中的局部相关性进行建模,因此可能存在泛化能力有限的问题。最近,视觉Transformer中出现了卷积操作与自注意力机制的混合,以同时利用局部和全局图像表征。这些混合视觉Transformer,也被称为CNN-Transformer架构,在视觉应用中展示了显著的结果。鉴于混合视觉Transformer数量的快速增长,有必要对这些混合架构进行分类和解释。本综述对最近的视觉Transformer架构进行了分类,更具体地说,是对混合视觉Transformer进行了分类。此外,还讨论了这些架构的关键特征,如注意力机制、位置嵌入、多尺度处理和卷积。与以往主要关注单个视觉Transformer架构或CNN的综述论文不同,本综述独特地强调了混合视觉Transformer的新兴趋势。通过展示混合视觉Transformer在一系列计算机视觉任务中提供卓越性能的潜力,本综述为这种快速发展的架构的未来方向提供了启示。

关键词

引用

@article{arxiv.2305.09880,
  title  = {A survey of the Vision Transformers and their CNN-Transformer based Variants},
  author = {Asifullah Khan and Zunaira Rauf and Anabia Sohail and Abdul Rehman and Hifsa Asif and Aqsa Asif and Umair Farooq},
  journal= {arXiv preprint arXiv:2305.09880},
  year   = {2024}
}

备注

Pages: 84, Figures: 16