协同尺度卷积注意力图像 Transformer
计算机视觉与模式识别
2021-08-27 v2 机器学习
神经与进化计算
摘要
在本文中,我们提出协同尺度卷积注意力图像 Transformer(CoaT),一种配备协同尺度和卷积注意力机制的基于 Transformer 的图像分类器。首先,协同尺度机制在各自尺度上保持 Transformer 编码器分支的完整性,同时允许不同尺度学习到的表示进行有效互通;我们设计了一系列串行和并行块来实现协同尺度机制。其次,我们通过在点积注意力模块中以高效类卷积实现相对位置嵌入公式,设计了卷积注意力机制。CoaT 赋予图像 Transformer 丰富的多尺度和上下文建模能力。在 ImageNet 上,相对较小的 CoaT 模型相比类似大小的卷积神经网络和图像/视觉 Transformer 取得了更优的分类结果。CoaT 主干网络在目标检测和实例分割上的有效性也得到展示,证明了其对下游计算机视觉任务的适用性。
引用
@article{arxiv.2104.06399,
title = {Co-Scale Conv-Attentional Image Transformers},
author = {Weijian Xu and Yifan Xu and Tyler Chang and Zhuowen Tu},
journal= {arXiv preprint arXiv:2104.06399},
year = {2021}
}
备注
Accepted to ICCV 2021 (Oral)