中文

DisCoScene:用于可控 3D 感知场景合成的空间解耦生成辐射场

计算机视觉与模式识别 2022-12-23 v1

摘要

现有的 3D 感知图像合成方法主要聚焦于生成单个规范物体,在组合包含多种物体的复杂场景时能力有限。本文提出 DisCoScene:一种用于高质量可控场景合成的 3D 感知生成模型。我们方法的关键要素是一种非常抽象的物体级表示(即无语义标注的 3D 边界框)作为场景布局先验,其易于获取、可通用地描述各类场景内容,且足以解耦物体与背景。此外,它作为直观的用户控制手段用于场景编辑。基于该先验,所提模型通过仅在 2D 图像上以全局-局部判别进行学习,将整个场景在空间上解耦为以物体为中心的生成辐射场。我们的模型在获得单个物体的生成保真度与编辑灵活性的同时,能够高效地将物体与背景组合为完整场景。我们在多个场景数据集(包括具有挑战性的 Waymo 室外数据集)上展示了最先进的性能。项目页面:https://snap-research.github.io/discoscene/

关键词

引用

@article{arxiv.2212.11984,
  title  = {DisCoScene: Spatially Disentangled Generative Radiance Fields for Controllable 3D-aware Scene Synthesis},
  author = {Yinghao Xu and Menglei Chai and Zifan Shi and Sida Peng and Ivan Skorokhodov and Aliaksandr Siarohin and Ceyuan Yang and Yujun Shen and Hsin-Ying Lee and Bolei Zhou and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2212.11984},
  year   = {2022}
}

备注

Project page: https://snap-research.github.io/discoscene/