中文

FroDO:从检测到 3D 物体

计算机视觉与模式识别 2020-05-12 v1

摘要

面向物体的地图对场景理解十分重要,因为它们联合捕捉几何与语义,允许个体实例化并对物体进行有意义的推理。我们提出 FroDO,一种从 RGB 视频精确重建物体实例的方法,以由粗到细的方式推断物体位置、姿态与形状。FroDO 的关键在于将物体形状嵌入一个新颖的学习空间中,该空间允许在稀疏点云与稠密 DeepSDF 解码之间无缝切换。给定输入的局部化 RGB 帧序列,FroDO 首先聚合 2D 检测,为每个物体实例化一个类别感知的 3D 边界框。在使用编码器网络回归形状码后,于学习到的形状先验下利用稀疏与稠密形状表示进一步优化形状与姿态。该优化采用多视角几何、光度与轮廓损失。我们在真实世界数据集(包括 Pix3D、Redwood-OS 与 ScanNet)上评估了单视图、多视图及多物体重建。

关键词

引用

@article{arxiv.2005.05125,
  title  = {FroDO: From Detections to 3D Objects},
  author = {Kejie Li and Martin Rünz and Meng Tang and Lingni Ma and Chen Kong and Tanner Schmidt and Ian Reid and Lourdes Agapito and Julian Straub and Steven Lovegrove and Richard Newcombe},
  journal= {arXiv preprint arXiv:2005.05125},
  year   = {2020}
}

备注

To be published in CVPR 2020. The first two authors contributed equally