BiFormer:具有双层路由注意力的视觉 Transformer
计算机视觉与模式识别
2023-03-16 v1
摘要
作为视觉 Transformer 的核心构建模块,注意力是捕获长程依赖的有力工具。然而,这种能力是有代价的:由于需计算所有空间位置间的成对 token 交互,它带来了巨大的计算负担与内存占用。一系列工作试图通过将手工设计且与内容无关的稀疏性引入注意力来缓解该问题,例如将注意力操作限制于局部窗口、轴向条带或空洞窗口内。与这些方法不同,我们提出一种通过双层路由实现的新型动态稀疏注意力,以在具备内容感知能力的同时实现更灵活的计算分配。具体而言,对于某个查询,先在粗粒度区域层面过滤掉无关的键值对,然后在剩余候选区域(即路由区域)的并集中施加细粒度的 token 到 token 注意力。我们给出了所提双层路由注意力的简洁而高效的实现,其利用稀疏性同时节省计算与内存,且仅涉及对 GPU 友好的稠密矩阵乘法。基于所提双层路由注意力,我们进而提出一种新的通用视觉 Transformer,名为 BiFormer。由于 BiFormer 以\textbf{查询自适应}的方式关注一小部分相关 token 而不受其他无关 token 干扰,它兼具良好性能与高计算效率,尤其在密集预测任务中。在图像分类、目标检测与语义分割等多项计算机视觉任务上的实证结果验证了我们的设计有效性。代码见 \url{https://github.com/rayleizhu/BiFormer}。
引用
@article{arxiv.2303.08810,
title = {BiFormer: Vision Transformer with Bi-Level Routing Attention},
author = {Lei Zhu and Xinjiang Wang and Zhanghan Ke and Wayne Zhang and Rynson Lau},
journal= {arXiv preprint arXiv:2303.08810},
year = {2023}
}
备注
CVPR 2023 camera-ready