中文

MVX-Net:用于三维目标检测的多模态 VoxelNet

计算机视觉与模式识别 2019-04-04 v1

摘要

许多近期关于三维目标检测的工作都聚焦于设计能够消费点云数据的神经网络架构。尽管这些方法展现出令人鼓舞的性能,但它们通常基于单一模态,无法利用来自其他模态(如相机)的信息。尽管少数方法融合了不同模态的数据,这些方法要么使用复杂的流水线依次处理各模态,要么执行后期融合,无法在早期阶段学习不同模态间的交互。本工作中,我们提出 PointFusion 与 VoxelFusion:两种简单而有效的早期融合方法,通过利用近期提出的 VoxelNet 架构来结合 RGB 与点云模态。在 KITTI 数据集上的评估表明,相较仅使用点云数据的方法,性能有显著提升。此外,所提方法取得了与最先进(SOTA)多模态算法相竞争的结果,凭借简单的单阶段网络,在 KITTI 基准测试的六个鸟瞰图与三维检测类别中的五个上取得前两名排名。

关键词

引用

@article{arxiv.1904.01649,
  title  = {MVX-Net: Multimodal VoxelNet for 3D Object Detection},
  author = {Vishwanath A. Sindagi and Yin Zhou and Oncel Tuzel},
  journal= {arXiv preprint arXiv:1904.01649},
  year   = {2019}
}

备注

7 pages