中文

ImGeoNet:用于多视角三维目标检测的图像诱导几何感知体素表示

计算机视觉与模式识别 2023-08-21 v1

摘要

我们提出ImGeoNet,一种基于多视角图像的三维目标检测框架,其通过图像诱导的几何感知体素表示对三维空间建模。与以往在不考虑几何的情况下将二维特征聚合为三维体素的方法不同,ImGeoNet学习从多视角图像中诱导几何以缓解自由空间体素引起的混淆,且在推理阶段仅需多视角图像。此外,我们提出的表示可利用强大的预训练二维特征提取器,从而获得更鲁棒的性能。为评估ImGeoNet的有效性,我们在三个室内数据集(即ARKitScenes、ScanNetV2和ScanNet200)上进行了定量与定性实验。结果表明,在检测精度上,ImGeoNet在所有三个数据集上均优于当前最先进的多视角图像基方法ImVoxelNet。另外,ImGeoNet展现出极高的数据效率:仅用40个视角即取得ImVoxelNet使用100个视角时可比的结果。进一步,我们的研究表明,所提出的图像诱导几何感知表示能使基于图像的方法在两种实际场景中取得优于开创性点云基方法VoteNet的检测精度:(1)点云稀疏且含噪的场景,如ARKitScenes中;(2)涉及多样物体类别、尤其是小物体类别的场景,如ScanNet200中的情况。

关键词

引用

@article{arxiv.2308.09098,
  title  = {ImGeoNet: Image-induced Geometry-aware Voxel Representation for Multi-view 3D Object Detection},
  author = {Tao Tu and Shun-Po Chuang and Yu-Lun Liu and Cheng Sun and Ke Zhang and Donna Roy and Cheng-Hao Kuo and Min Sun},
  journal= {arXiv preprint arXiv:2308.09098},
  year   = {2023}
}

备注

ICCV'23; project page: https://ttaoretw.github.io/imgeonet/