CAT:视觉 Transformer 中的交叉注意力
计算机视觉与模式识别
2021-06-11 v1 人工智能
摘要
自 Transformer 在 NLP 中得到广泛应用以来,其在 CV 中的潜力已被认识并启发了许多新方法。然而,在图像分块后将以词 token 替换为图像块交由 Transformer 处理所需的计算量巨大(如 ViT),这制约了模型训练与推理。本文提出一种称为交叉注意力的 Transformer 新注意力机制,其在图像块内部交替进行注意力以捕获局部信息,并在由单通道特征图划分出的图像块之间施加注意力以捕获全局信息。两种操作的计算量均小于 Transformer 中的标准自注意力。通过交替应用块内与块间注意力,我们实现了交叉注意力,以更低计算成本保持性能,并构建了称为交叉注意力 Transformer(CAT)的层次化网络用于其他视觉任务。我们的基础模型在 ImageNet-1K 上达到 SOTA,并提升了其他方法在 COCO 与 ADE20K 上的表现,表明我们的网络有潜力作为通用骨干网络。代码与模型见 \url{https://github.com/linhezheng19/CAT}。
引用
@article{arxiv.2106.05786,
title = {CAT: Cross Attention in Vision Transformer},
author = {Hezheng Lin and Xing Cheng and Xiangyu Wu and Fan Yang and Dong Shen and Zhongyuan Wang and Qing Song and Wei Yuan},
journal= {arXiv preprint arXiv:2106.05786},
year = {2021}
}
备注
9 pages, 4 figures