中文

CvT:将卷积引入视觉Transformer

计算机视觉与模式识别 2021-03-30 v1

摘要

我们在本文中提出一种新架构,称为卷积视觉Transformer(CvT),它通过将卷积引入ViT,兼具两类设计的优势,从而在性能与效率上改进视觉Transformer(ViT)。这通过两个主要改进实现:包含新型卷积token嵌入的Transformer层级结构,以及利用卷积投影的卷积Transformer模块。这些改变将卷积神经网络(CNNs)的理想特性(即平移、尺度和畸变不变性)引入ViT架构,同时保留Transformer的优点(即动态注意力、全局上下文和更好的泛化性)。我们通过大量实验验证CvT,表明该方法在ImageNet-1k上以更少的参数量和更低的FLOPs,取得了优于其他视觉Transformer和ResNets的state-of-the-art性能。此外,在更大数据集(如ImageNet-22k)上预训练并微调至下游任务时,性能增益得以保持。在ImageNet-22k上预训练后,我们的CvT-W24在ImageNet-1k验证集上获得了87.7%的top-1准确率。最后,我们的结果表明,现有视觉Transformer中的关键组件——位置编码,可在我们的模型中安全移除,从而简化面向更高分辨率视觉任务的设计。代码将发布于\url{https://github.com/leoxiaobin/CvT}。

关键词

引用

@article{arxiv.2103.15808,
  title  = {CvT: Introducing Convolutions to Vision Transformers},
  author = {Haiping Wu and Bin Xiao and Noel Codella and Mengchen Liu and Xiyang Dai and Lu Yuan and Lei Zhang},
  journal= {arXiv preprint arXiv:2103.15808},
  year   = {2021}
}