Diorama: 无监督零样本单视图 3D 室内场景建模
计算机视觉与模式识别
2025-03-18 v2 机器学习
摘要
从 RGB 图像重建结构化 3D 场景并使用 CAD 对象,可实现高效且紧凑的场景表示,同时保持构图性和可交互性。现有工作提出的训练密集型方法依赖昂贵且不准确的真实世界标注,或依赖可控但单调的合成数据,难以泛化到未见对象或领域。我们提出 Diorama,首个无需端到端训练或人工标注的零样本开放世界系统,能够从单视图 RGB 观察中全面建模 3D 场景。通过将问题分解为子任务并为每个子任务引入鲁棒且可泛化的解决方案,展示了我们方法的可行性:包括架构重建、3D 形状检索、物体姿态估计和场景布局优化。我们在合成数据和真实数据上进行评估,显示我们显著优于 prior work 中的基线方法。我们还展示了对互联网图像和文本到场景任务的泛化能力。
引用
@article{arxiv.2411.19492,
title = {Diorama: Unleashing Zero-shot Single-view 3D Indoor Scene Modeling},
author = {Qirui Wu and Denys Iliash and Daniel Ritchie and Manolis Savva and Angel X. Chang},
journal= {arXiv preprint arXiv:2411.19492},
year = {2025}
}