中文

3DP3:基于概率编程的三维场景感知

计算机视觉与模式识别 2021-11-02 v1 人工智能

摘要

我们提出 3DP3,一个用于逆图形学的框架,该框架在物体、场景与图像的结构化生成模型中进行推断。3DP3 使用 (i) 体素模型表示物体的三维形状,(ii) 层次化场景图将场景分解为物体及其之间的接触,(iii) 基于实时图形的深度图像似然。给定一张观测到的 RGB-D 图像,3DP3 的推断算法利用快速自底向上的位姿提议、新颖的对合 MCMC 场景图结构更新,以及(可选的)神经物体检测器与位姿估计器,推断出潜在的底层三维场景,包括物体位姿及这些位姿的简洁联合参数化。我们表明 3DP3 能够实现感知三维形状、遮挡与接触结构的场景理解。我们的结果表明,在真实图像的 6DoF 物体位姿估计上,3DP3 比深度学习基线更准确,并且对具有新颖视角、接触和部分可观测性的挑战性场景表现出更好的泛化能力。

关键词

引用

@article{arxiv.2111.00312,
  title  = {3DP3: 3D Scene Perception via Probabilistic Programming},
  author = {Nishad Gothoskar and Marco Cusumano-Towner and Ben Zinberg and Matin Ghavamizadeh and Falk Pollok and Austin Garrett and Joshua B. Tenenbaum and Dan Gutfreund and Vikash K. Mansinghka},
  journal= {arXiv preprint arXiv:2111.00312},
  year   = {2021}
}

备注

NeurIPS 2021