中文

用于3D实例分割的无掩码注意力Transformer

计算机视觉与模式识别 2023-09-06 v1

摘要

近年来,基于Transformer的方法在3D实例分割中占据主导地位,其中通常涉及掩码注意力。具体而言,目标查询在第一次交叉注意力中由初始实例掩码引导,随后以类似方式迭代细化自身。然而,我们观察到掩码注意力流程由于初始实例掩码低召回率通常导致收敛缓慢。因此,我们放弃掩码注意力设计,转而借助辅助中心回归任务。通过中心回归,我们有效克服了低召回率问题,并通过施加位置先验来执行交叉注意力。为实现该目标,我们开发了一系列位置感知设计。首先,我们学习3D位置的空间分布作为初始位置查询。它们在3D空间中密集分布,从而能够轻松以高召回率捕获场景中的物体。此外,我们提出用于交叉注意力的相对位置编码以及用于更精确位置查询的迭代细化。实验表明,我们的方法比现有工作收敛快4倍,在ScanNetv2 3D实例分割基准上确立了新的SOTA,并在多个数据集上展现出优越性能。代码与模型见https://github.com/dvlab-research/Mask-Attention-Free-Transformer。

关键词

引用

@article{arxiv.2309.01692,
  title  = {Mask-Attention-Free Transformer for 3D Instance Segmentation},
  author = {Xin Lai and Yuhui Yuan and Ruihang Chu and Yukang Chen and Han Hu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2309.01692},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Code and models are available at https://github.com/dvlab-research/Mask-Attention-Free-Transformer