中文

Architect: 基于分层二维修复生成生动交互的三维场景

计算机视觉与模式识别 2024-11-18 v1

摘要

创建大规模交互式三维环境对于机器人学和具身 AI 研究的发展至关重要。当前方法包括人工设计、程序化生成、基于扩散的场景生成和大语言模型(LLM)引导的场景设计,均受限于人力成本过高、依赖预定义规则或训练数据集、三维空间推理能力有限等局限。由于预训练的二维图像生成模型比 LLM 更能捕捉场景和物体配置,我们通过引入 Architect 这一生成框架来应对这些挑战,利用基于扩散的二维图像修复创建复杂逼真的三维具身环境。具体而言,我们利用基础视觉感知模型从图像中获取每个生成的物体,并利用预训练的深度估计模型将生成的二维图像提升至三维空间。我们的流程进一步扩展为分层迭代修复过程,持续生成大型家具和小物体的摆放以丰富场景。这种迭代结构使我们的方法能从各种起点(如文本、平面图或预先布置的环境)生成或细化场景。

关键词

引用

@article{arxiv.2411.09823,
  title  = {Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting},
  author = {Yian Wang and Xiaowen Qiu and Jiageng Liu and Zhehuan Chen and Jiting Cai and Yufei Wang and Tsun-Hsuan Wang and Zhou Xian and Chuang Gan},
  journal= {arXiv preprint arXiv:2411.09823},
  year   = {2024}
}