中文

面向三维目标检测的多模态任务级联网络

计算机视觉与模式识别 2021-07-09 v1 人工智能 机器学习 机器人学

摘要

点云与 RGB 图像是三维视觉理解中天然互补的模态——前者提供物体上点的稀疏但精确的位置,而后者包含密集的颜色与纹理信息。尽管存在紧密传感器融合的潜力,许多方法孤立地训练两个模型,并使用简单的特征拼接来表示三维传感器数据。这种分离训练方案导致潜在的次优性能,并阻碍三维任务用于惠及通常自身有用的二维任务。为提供更一体化的方法,我们提出一种新颖的多模态任务级联网络(MTC-RCNN),其利用三维框提议改善二维分割预测,而这些预测随后被用于进一步精炼三维框。我们表明,在两个阶段的三维模块之间加入二维网络显著提升了二维与三维任务性能。此外,为防止三维模块过度依赖过拟合的二维预测,我们提出双头二维分割训练与推理方案,使第二个三维模块学会解读不完美的二维分割预测。在具挑战性的 SUN RGB-D 数据集上评估我们的模型,我们以大幅优势(+3.8\textbf{+3.8} [email protected])超越了单模态与融合网络的 SOTA 结果。代码将发布于 \href\href{https://github.com/Divadi/MTC_RCNN}{\text{here.}}

关键词

引用

@article{arxiv.2107.04013,
  title  = {Multi-Modality Task Cascade for 3D Object Detection},
  author = {Jinhyung Park and Xinshuo Weng and Yunze Man and Kris Kitani},
  journal= {arXiv preprint arXiv:2107.04013},
  year   = {2021}
}