重新思考视觉Transformer中的查询-键成对交互
计算机视觉与模式识别
2022-07-05 v2
摘要
视觉Transformer已在许多视觉任务中取得最先进性能。由于自注意力的二次计算与内存复杂度,近期工作要么仅对低分辨率输入应用注意力,要么将感受野限制于小的局部区域。为克服这些局限,我们提出仅键注意力(key-only attention),其排除查询-键成对交互并使用计算高效的显著性门控获取注意力权重,在所有阶段建模局部-全局交互。仅键注意力相对于输入尺寸具有线性的计算与内存复杂度。我们采用交替布局来混合卷积与注意力层,而非先前工作建议的嫁接,从而使所有阶段均能受益于空间注意力与卷积。我们利用这些改进开发了新的自注意力模型族LinGlos,其在ImageNet分类基准的参数受限设定下达到最先进准确率,并在下游任务(如COCO目标检测与ADE20K语义分割)中显著优于基线。
引用
@article{arxiv.2207.00188,
title = {Rethinking Query-Key Pairwise Interactions in Vision Transformers},
author = {Cheng Li and Yangxin Liu},
journal= {arXiv preprint arXiv:2207.00188},
year = {2022}
}