中文

MLCVNet:用于三维目标检测的多层级上下文 VoteNet

计算机视觉与模式识别 2020-04-14 v1 图形学

摘要

在本文中,我们通过自注意力机制和多尺度特征融合捕获多层级上下文信息,来解决三维目标检测任务。大多数现有的三维目标检测方法独立地识别物体,未考虑这些物体之间的上下文信息。相比之下,我们提出多层级上下文 VoteNet(MLCVNet),在先进的 VoteNet 基础上关联地识别三维物体。我们在 VoteNet 的投票和分类阶段引入三个上下文模块,以在不同层级编码上下文信息。具体而言,在投票得到对应物体质心点之前,采用块间上下文(PPC)模块捕获点块之间的上下文信息。随后,在提议和分类阶段之前加入物体间上下文(OOC)模块,以捕获物体候选之间的上下文信息。最后,设计全局场景上下文(GSC)模块来学习全局场景上下文。我们通过在块、物体和场景层级捕获上下文信息展示了这些方法。我们的方法是提升检测精度的有效途径,在具有挑战性的三维目标检测数据集(即 SUN RGBD 和 ScanNet)上取得了新的 SOTA 检测性能。我们也在 https://github.com/NUAAXQ/MLCVNet 发布了代码。

关键词

引用

@article{arxiv.2004.05679,
  title  = {MLCVNet: Multi-Level Context VoteNet for 3D Object Detection},
  author = {Qian Xie and Yu-Kun Lai and Jing Wu and Zhoutao Wang and Yiming Zhang and Kai Xu and Jun Wang},
  journal= {arXiv preprint arXiv:2004.05679},
  year   = {2020}
}

备注

To be presented at CVPR 2020