中文

协同尺度卷积注意力图像 Transformer

计算机视觉与模式识别 2021-08-27 v2 机器学习 神经与进化计算

摘要

在本文中,我们提出协同尺度卷积注意力图像 Transformer(CoaT),一种配备协同尺度和卷积注意力机制的基于 Transformer 的图像分类器。首先,协同尺度机制在各自尺度上保持 Transformer 编码器分支的完整性,同时允许不同尺度学习到的表示进行有效互通;我们设计了一系列串行和并行块来实现协同尺度机制。其次,我们通过在点积注意力模块中以高效类卷积实现相对位置嵌入公式,设计了卷积注意力机制。CoaT 赋予图像 Transformer 丰富的多尺度和上下文建模能力。在 ImageNet 上,相对较小的 CoaT 模型相比类似大小的卷积神经网络和图像/视觉 Transformer 取得了更优的分类结果。CoaT 主干网络在目标检测和实例分割上的有效性也得到展示,证明了其对下游计算机视觉任务的适用性。

关键词

引用

@article{arxiv.2104.06399,
  title  = {Co-Scale Conv-Attentional Image Transformers},
  author = {Weijian Xu and Yifan Xu and Tyler Chang and Zhuowen Tu},
  journal= {arXiv preprint arXiv:2104.06399},
  year   = {2021}
}

备注

Accepted to ICCV 2021 (Oral)