BoxeR:面向二维与三维 Transformer 的框注意力
计算机视觉与模式识别
2022-03-28 v2
摘要
在本文中,我们提出一种简单的注意力机制,称之为框注意力(box-attention)。它能够在从感兴趣框中采样得到的网格特征之间实现空间交互,并提升 Transformer 在若干视觉任务中的学习能力。具体而言,我们提出 BoxeR(即 Box Transformer 的简称),它通过预测输入特征图上参考窗口到一组框的变换来对这些框进行注意力计算。BoxeR 通过考虑框的网格结构来计算这些框上的注意力权重。值得注意的是,BoxeR-2D 在其注意力模块中自然地对框信息进行推理,使其适用于端到端实例检测与分割任务。通过在框注意力模块中学习对旋转的不变性,BoxeR-3D 能够从鸟瞰平面生成具有判别性的信息,用于三维端到端目标检测。我们的实验表明,所提出的 BoxeR-2D 在 COCO 检测与实例分割上取得了最先进(state-of-the-art)的结果。此外,BoxeR-3D 优于端到端三维目标检测基线,并且在不进行任何类别特定优化的情况下,已经在 Waymo Open 的车辆类别上获得了引人注目的性能。代码见 https://github.com/kienduynguyen/BoxeR。
引用
@article{arxiv.2111.13087,
title = {BoxeR: Box-Attention for 2D and 3D Transformers},
author = {Duy-Kien Nguyen and Jihong Ju and Olaf Booij and Martin R. Oswald and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2111.13087},
year = {2022}
}
备注
In Proceeding of CVPR'2022