中文

协同整体场景理解:统一三维物体、布局与相机位姿估计

计算机视觉与模式识别 2019-02-22 v2

摘要

整体三维室内场景理解是指联合恢复 i) 物体包围盒、ii) 房间布局以及 iii) 相机位姿,均为三维。现有方法要么效率低下,要么仅部分解决问题。本文中,我们提出一种端到端模型,在仅给定单张 RGB 图像的情况下实时同时求解全部三项任务。所提方法的本质是通过 i) 对目标(如三维包围盒)进行参数化而非直接估计目标,以及 ii) 跨不同模块的协同训练(而非各自独立训练)来改进预测。具体而言,我们通过若干模块(即三维相机位姿与物体属性)的预测来参数化三维物体包围盒。所提方法具有两大优势:i) 参数化有助于维持二维图像与三维世界间的一致性,从而大幅降低三维坐标的预测方差。ii) 可对参数化施加约束以同时训练不同模块。我们称这些约束为“协同损失”,因其实现了联合训练与推理。我们采用三种协同损失分别作用于三维包围盒、二维投影与物理约束,以估计几何一致且物理合理的三维场景。在 SUN RGB-D 数据集上的实验表明,所提方法在三维物体检测、三维布局估计、三维相机位姿估计及整体场景理解上均显著优于已有方法。

关键词

引用

@article{arxiv.1810.13049,
  title  = {Cooperative Holistic Scene Understanding: Unifying 3D Object, Layout, and Camera Pose Estimation},
  author = {Siyuan Huang and Siyuan Qi and Yinxue Xiao and Yixin Zhu and Ying Nian Wu and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:1810.13049},
  year   = {2019}
}

备注

Accepted by NeurIPS 2018