中文

ImVoxelNet:用于单目与多视角通用三维目标检测的图像到体素投影方法

计算机视觉与模式识别 2021-10-18 v3

摘要

在本文中,我们引入多视角基于 RGB 的三维目标检测任务,将其作为一个端到端优化问题。为解决该问题,我们提出 ImVoxelNet,一种基于单目或多视角 RGB 图像的新型全卷积三维目标检测方法。每个多视角输入中的单目图像数量在训练和推理期间可以变化;实际上,该数量对于每个多视角输入可能是唯一的。ImVoxelNet 成功处理室内和室外场景,这使其具有通用性。具体而言,在接收 RGB 图像的所有方法中,它在 KITTI(单目)和 nuScenes(多视角)基准测试的车检测上取得了最先进的结果。此外,它在 SUN RGB-D 数据集上超越了现有的基于 RGB 的三维目标检测方法。在 ScanNet 上,ImVoxelNet 为的多视角三维目标检测设立了新基准。源代码和训练好的模型可在 https://github.com/saic-vul/imvoxelnet 获取。

关键词

引用

@article{arxiv.2106.01178,
  title  = {ImVoxelNet: Image to Voxels Projection for Monocular and Multi-View General-Purpose 3D Object Detection},
  author = {Danila Rukhovich and Anna Vorontsova and Anton Konushin},
  journal= {arXiv preprint arXiv:2106.01178},
  year   = {2021}
}