DreamUp3D:面向单视图3D场景理解和真实到仿真迁移的以对象为中心的生成模型
机器人学
2024-02-27 v1
摘要
机器人应用的3D场景理解具有一系列独特要求,包括实时推理、以对象为中心的潜在表示学习、准确的6D位姿估计和对象3D重建。当前的场景理解方法通常依赖于训练模型与显式或学习到的体积表示的组合,这些方法各有其缺点和局限性。我们提出DreamUp3D,一种新颖的以对象为中心的生成模型(OCGM),专门设计用于仅凭单张RGB-D图像对3D场景进行推理。DreamUp3D是一种自监督模型,端到端训练,能够分割对象、提供3D对象重建、生成以对象为中心的潜在表示以及每个对象的准确6D位姿估计。我们在包括3D场景重建、对象匹配和对象位姿估计等一系列任务中,将DreamUp3D与基线方法(包括NeRF、预训练CLIP特征、ObSurf和ObPose)进行比较。实验表明,在真实场景中,我们的模型在所有基线上取得了显著优势,展示了其在3D场景理解任务中的适用性,同时满足机器人应用的严格需求。
引用
@article{arxiv.2402.16308,
title = {DreamUp3D: Object-Centric Generative Models for Single-View 3D Scene Understanding and Real-to-Sim Transfer},
author = {Yizhe Wu and Haitz Sáez de Ocáriz Borde and Jack Collins and Oiwi Parker Jones and Ingmar Posner},
journal= {arXiv preprint arXiv:2402.16308},
year = {2024}
}