中文

SceneFactor:基于因子化潜在3D扩散的可控3D场景生成

计算机视觉与模式识别 2024-12-04 v2

摘要

我们提出SceneFactor,一种基于扩散模型的大规模3D场景生成方法,支持可控生成和无缝编辑。SceneFactor通过我们的因子化扩散公式实现文本导向的3D场景合成,利用潜在语义和几何流形生成任意大小的3D场景。虽然文本输入可实现简单、可控的生成,但文本指导对直观的、局部的3D场景编辑和操作仍不够精确。我们的因子化语义扩散生成由语义3D盒子组成的代理语义空间,以可控的方式编辑生成的场景,通过添加、删除或更改语义3D代理盒子的大小,从而实现高保真、一致的3D几何编辑。广泛的实验表明,我们的方法能够实现高保真的3D场景合成,并通过我们的因子化扩散方法实现有效的可控编辑。

关键词

引用

@article{arxiv.2412.01801,
  title  = {SceneFactor: Factored Latent 3D Diffusion for Controllable 3D Scene Generation},
  author = {Alexey Bokhovkin and Quan Meng and Shubham Tulsiani and Angela Dai},
  journal= {arXiv preprint arXiv:2412.01801},
  year   = {2024}
}

备注

21 pages, 12 figures; https://alexeybokhovkin.github.io/scenefactor/