SceneWiz3D:面向文本引导的 3D 场景合成
计算机视觉与模式识别
2023-12-15 v1
摘要
我们正见证从文本生成 3D 物体技术的重大突破。现有方法要么利用大型文本到图像模型来优化 3D 表示,要么在以物体为中心的数据集上训练 3D 生成器。然而,生成完整场景仍然极具挑战性,因为场景包含多个 3D 物体,且多样而分散。在本工作中,我们引入了 SceneWiz3D,一种从文本合成高保真 3D 场景的新方法。我们通过引入混合 3D 表示——物体采用显式表示,场景采用隐式表示——将物体的局部性与场景的全局性相结合。值得注意的是,显式表示的物体既可以使用传统的文本到 3D 方法从文本生成,也可以由用户提供。为了配置场景布局并自动放置物体,我们在优化过程中应用了粒子群优化技术。此外,场景的某些部分(如角落、遮挡)难以接收多视图监督,导致几何质量较差。我们引入了 RGBD 全景扩散模型来缓解这一问题,从而获得高质量的几何结构。大量评估表明,我们的方法在质量上超越了以往方法,能够生成细节丰富且视图一致的 3D 场景。
引用
@article{arxiv.2312.08885,
title = {SceneWiz3D: Towards Text-guided 3D Scene Composition},
author = {Qihang Zhang and Chaoyang Wang and Aliaksandr Siarohin and Peiye Zhuang and Yinghao Xu and Ceyuan Yang and Dahua Lin and Bolei Zhou and Sergey Tulyakov and Hsin-Ying Lee},
journal= {arXiv preprint arXiv:2312.08885},
year = {2023}
}
备注
Project page: https://zqh0253.github.io/SceneWiz3D/