中文

用于3D场景合成的视频感知模型

计算机视觉与模式识别 2025-06-26 v1

摘要

传统上,3D场景合成需要专业知识和大量的人工努力。自动化这一过程将极大地有益于建筑设计、机器人仿真、虚拟现实和游戏等领域。近期3D场景合成的方法通常依赖大语言模型(LLMs)的常识推理或现代图像生成模型的强视觉先验。然而,当前的LLMs表现出有限的3D空间推理能力,这限制了其生成逼真且连贯的3D场景的能力。同时,基于图像生成的方法常受限于视角选择和多视角不一致性。在本工作中,我们提出了用于3D场景合成的视频感知模型(VIPScene),这是一个新颖的框架,利用视频生成模型中编码的3D物理世界的常识知识,以确保跨视角的连贯场景布局和一致物体放置。VIPScene接受文本和图像提示,并无缝集成视频生成、前馈3D重建和开放词汇感知模型,以对场景中的每个物体进行语义和几何分析。这实现了具有高真实感和结构一致性的灵活场景合成。为了进行更精确的分析,我们进一步引入了第一人称视角评分(FPVScore)用于连贯性和合理性评估,利用连续的第一人称视角以发挥多模态大语言模型的推理能力。大量实验表明,VIPScene显著优于现有方法,并在多种场景中具有良好的泛化能力。代码将公开发布。

关键词

引用

@article{arxiv.2506.20601,
  title  = {Video Perception Models for 3D Scene Synthesis},
  author = {Rui Huang and Guangyao Zhai and Zuria Bauer and Marc Pollefeys and Federico Tombari and Leonidas Guibas and Gao Huang and Francis Engelmann},
  journal= {arXiv preprint arXiv:2506.20601},
  year   = {2025}
}