面向视觉Transformer的四叉树注意力
计算机视觉与模式识别
2022-03-25 v2
摘要
Transformer已在诸多视觉任务中取得成功,这归功于其捕捉长程依赖的能力。然而,其二次计算复杂度对将其应用于目标检测、特征匹配、立体匹配等需要密集预测的视觉任务造成了主要障碍。我们提出四叉树注意力(QuadTree Attention),将计算复杂度由二次降为线性。我们的四叉树Transformer构建令牌金字塔并以由粗到细的方式计算注意力。在每一层,选取注意力分数最高的前K个图像块,从而下一层仅在对应这些前K个块的相关区域内计算注意力。我们证明四叉树注意力在各种视觉任务中达到最先进性能,例如在ScanNet特征匹配上提升4.0%,立体匹配中flops减少约50%,ImageNet分类top-1准确率提升0.4-1.5%,COCO目标检测提升1.2-1.8%,语义分割较此前最先进Transformer提升0.7-2.4%。代码见https://github.com/Tangshitao/QuadtreeAttention。
引用
@article{arxiv.2201.02767,
title = {QuadTree Attention for Vision Transformers},
author = {Shitao Tang and Jiahui Zhang and Siyu Zhu and Ping Tan},
journal= {arXiv preprint arXiv:2201.02767},
year = {2022}
}
备注
ICLR2022