ObPose:利用位姿进行三维中以对象为中心的场景推断与生成
计算机视觉与模式识别
2023-06-13 v3 人工智能
摘要
我们提出 ObPose,一种无监督的以对象为中心的推断与生成模型,它从 RGB-D 场景中学习三维结构化潜在表示。受二维表示学习先前工作的启发,ObPose 考虑一个分解的潜在空间,分别编码对象位置(where)和外观(what)。ObPose 进一步利用通过最小体积原理定义的对象的位姿(即位置和方向)作为学习 where 分量的新归纳偏置。为此,我们提出一种高效的体素化近似方法,直接从神经辐射场(NeRF)恢复对象形状。因此,ObPose 将每个场景建模为 NeRF 的组合,丰富地表示各个对象。为评估所学表示的质量,ObPose 在 YCB、MultiShapeNet 和 CLEVR 数据集上针对无监督场景分割进行定量评估,以显著优势超越当前最先进的三维场景推断方法(ObSuRF)。生成结果提供了定性演示:同一个 ObPose 模型既能生成新场景,也能灵活编辑其中的对象。这些能力再次反映了所学潜在表示的质量以及解耦场景 where 和 what 分量的益处。ObPose 编码器中做出的关键设计选择通过消融实验得到验证。
引用
@article{arxiv.2206.03591,
title = {ObPose: Leveraging Pose for Object-Centric Scene Inference and Generation in 3D},
author = {Yizhe Wu and Oiwi Parker Jones and Ingmar Posner},
journal= {arXiv preprint arXiv:2206.03591},
year = {2023}
}
备注
14 pages, 4 figures