具有可变形注意力的视觉 Transformer
计算机视觉与模式识别
2022-05-25 v3
摘要
Transformer 近来在各种视觉任务上展现出优越性能。大而有时甚至是全局的感受野赋予了 Transformer 模型相较其 CNN 对应物更高的表示能力。然而,简单地扩大感受野也引发若干担忧。一方面,使用如 ViT 中的稠密注意力会导致过高的内存与计算开销,且特征可能受到感兴趣区域之外无关部分的影响。另一方面,PVT 或 Swin Transformer 中采用的稀疏注意力是与数据无关的,可能限制建模长距离关系的能力。为缓解这些问题,我们提出一种新颖的可变形自注意力模块,其中自注意力中键与值对的位置以数据依赖的方式选取。这种灵活机制使自注意力模块能够聚焦于相关区域并捕获更具信息量的特征。在此基础上,我们提出 Deformable Attention Transformer,一种兼具可变形注意力的通用骨干模型,用于图像分类与密集预测任务。大量实验表明我们的模型在综合基准上取得了一致的改进结果。代码见 https://github.com/LeapLabTHU/DAT。
关键词
引用
@article{arxiv.2201.00520,
title = {Vision Transformer with Deformable Attention},
author = {Zhuofan Xia and Xuran Pan and Shiji Song and Li Erran Li and Gao Huang},
journal= {arXiv preprint arXiv:2201.00520},
year = {2022}
}
备注
Accepted by CVPR2022 (12 pages, 7 figures)