中文

CrossViT:用于图像分类的交叉注意力多尺度视觉Transformer

计算机视觉与模式识别 2021-08-24 v2

摘要

近年来开发的视觉 transformer(ViT)相比卷积神经网络在图像分类上取得了有前景的结果。受此启发,本文研究如何在 transformer 模型中学习用于图像分类的多尺度特征表示。为此,我们提出一种双分支 transformer,将不同大小的图像块(即 transformer 中的 token)组合起来以产生更强的图像特征。我们的方法以两个具有不同计算复杂度的独立分支处理小图像块和大图像块 token,然后这些 token 通过注意力多次纯融合以相互补充。此外,为降低计算量,我们开发了一个基于交叉注意力的简单而有效的 token 融合模块,该模块对每个分支使用单个 token 作为查询与其他分支交换信息。我们提出的交叉注意力在计算和内存复杂度上仅需线性时间,而非原本的二次时间。大量实验表明,我们的方法优于或与若干并行的视觉 transformer 工作以及高效的 CNN 模型性能相当。例如,在 ImageNet1K 数据集上,经过一些架构改变,我们的方法以较小到中等的 FLOPs 和模型参数增加,大幅超越近期的 DeiT 达 2%。我们的源代码和模型可在 \url{https://github.com/IBM/CrossViT} 获取。

关键词

引用

@article{arxiv.2103.14899,
  title  = {CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification},
  author = {Chun-Fu Chen and Quanfu Fan and Rameswar Panda},
  journal= {arXiv preprint arXiv:2103.14899},
  year   = {2021}
}

备注

Accepted by ICCV 2021