中文

ImVoteNet:利用图像投票提升点云中的三维目标检测

计算机视觉与模式识别 2020-01-30 v1

摘要

得益于点云上深度学习的进展,三维目标检测取得了快速进步。最近的一些工作甚至仅使用点云输入(例如 VoteNet)就展示了最先进的性能。然而,点云数据具有固有的局限性。它们稀疏、缺乏颜色信息且常受传感器噪声影响。另一方面,图像具有高分辨率和丰富的纹理。因此它们可以补充点云提供的三维几何信息。然而如何有效利用图像信息来辅助基于点云的检测仍是一个开放问题。在本工作中,我们在 VoteNet 基础上提出一种称为 ImVoteNet 的专用于 RGB-D 场景的三维检测架构。ImVoteNet 基于融合图像中的二维投票和点云中的三维投票。与先前多模态检测的工作相比,我们显式地从二维图像中提取几何与语义特征。我们利用相机参数将这些特征提升到三维。为改善二维-三维特征融合的协同作用,我们还提出了一种多塔训练方案。我们在具有挑战性的 SUN RGB-D 数据集上验证了我们的模型,将最先进结果提升了 5.7 mAP。我们还提供了丰富的消融研究来分析每种设计选择的贡献。

关键词

引用

@article{arxiv.2001.10692,
  title  = {ImVoteNet: Boosting 3D Object Detection in Point Clouds with Image Votes},
  author = {Charles R. Qi and Xinlei Chen and Or Litany and Leonidas J. Guibas},
  journal= {arXiv preprint arXiv:2001.10692},
  year   = {2020}
}