中文

PerspectiveNet:基于透视点从单张RGB图像进行三维目标检测

计算机视觉与模式识别 2019-12-18 v1

摘要

从单张RGB图像中检测三维目标本质上是模糊的,因此需要适当的先验知识和中间表示作为约束,以降低不确定性并改善二维图像平面与三维世界坐标之间的一致性。为应对这一挑战,我们提出采用透视点作为三维目标检测的一种新的中间表示,其定义为局部曼哈顿三维关键点的二维投影以定位目标;这些透视点满足透视投影所施加的几何约束。我们进一步设计了PerspectiveNet,一种端到端可训练的模型,可从单张RGB图像中同时检测每个目标的二维边界框、二维透视点和三维目标边界框。PerspectiveNet具有三个独特优势:(i) 三维目标边界框基于透视点估计,在不依赖类别特定三维形状先验的情况下弥合了二维与三维边界框之间的差距。(ii) 其通过基于模板的方法预测透视点,并构造透视损失以维持透视约束。(iii) 其通过可微投影函数保持二维透视点与三维边界框之间的一致性。在SUN RGB-D数据集上的实验表明,所提方法在三维目标检测上显著优于现有的基于RGB的方法。

关键词

引用

@article{arxiv.1912.07744,
  title  = {PerspectiveNet: 3D Object Detection from a Single RGB Image via Perspective Points},
  author = {Siyuan Huang and Yixin Chen and Tao Yuan and Siyuan Qi and Yixin Zhu and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:1912.07744},
  year   = {2019}
}

备注

NeurIPS 2019