中文

用于视觉与点云三维目标检测的桥接 Transformer

计算机视觉与模式识别 2022-10-05 v1

摘要

三维目标检测是计算机视觉中的重要研究课题,传统设置中通常使用三维点云作为输入。近来,利用多源输入数据的趋势显现,例如用通常具有更丰富颜色和更少噪声的二维图像来补充三维点云。然而,由于二维与三维表示的几何异构性,我们无法直接套用现成的神经网络来实现多模态融合。为此,我们提出 Bridged Transformer (BrT),一种用于三维目标检测的端到端架构。BrT 简单而有效,它学习从点体和图像块中识别三维与二维目标边界框。BrT 的关键要素在于利用目标查询来桥接三维与二维空间,从而在 Transformer 中统一不同来源的数据表示。我们采用由点到块投影实现的特征聚合形式,进一步加强图像与点之间的关联。此外,BrT 可无缝融合点云与多视图图像。我们通过实验表明,BrT 在 SUN RGB-D 和 ScanNetV2 数据集上超越了最先进的方法。

关键词

引用

@article{arxiv.2210.01391,
  title  = {Bridged Transformer for Vision and Point Cloud 3D Object Detection},
  author = {Yikai Wang and TengQi Ye and Lele Cao and Wenbing Huang and Fuchun Sun and Fengxiang He and Dacheng Tao},
  journal= {arXiv preprint arXiv:2210.01391},
  year   = {2022}
}

备注

CVPR 2022