CompoNeRF:基于文本引导与可编辑三维场景布局的多物体组合式NeRF
计算机视觉与模式识别
2024-09-25 v5
摘要
文本到三维形式在为 AR/VR 创建可编辑三维场景中起着关键作用。近期进展展示了将神经辐射场(NeRF)与预训练扩散模型结合用于文本到三维物体生成的前景。然而,一个长期存在的挑战是其准确解析并重建一致多物体环境的能力不足。具体而言,这些模型难以准确表征多物体文本所指示的数量与风格,常导致渲染保真度崩溃,无法匹配语义细节。此外,将这些元素融合为连贯的三维场景也是一大挑战,其源于扩散模型固有的泛化分布。为应对“引导崩溃”问题并进一步增强场景一致性,我们提出一种新颖框架 CompoNeRF,将可编辑三维场景布局与物体级和场景级引导机制相整合。它首先将复杂文本解析为包含多个 NeRF 的布局,每个 NeRF 配有对应子文本提示以精确刻画物体;随后,定制的组合模块无缝融合这些 NeRF 以促进一致性,而双级文本引导降低歧义并提升精度。值得注意的是,我们的组合设计支持解耦,可基于编辑后的布局或文本提示灵活编辑场景并重组为新场景。利用开源 Stable Diffusion 模型,CompoNeRF 生成高保真多物体场景。显著地,我们的框架通过多视角 CLIP 分数指标实现了高达 \textbf{54\%} 的提升。用户研究表明,我们的方法在多物体场景生成的语义准确性、多视角一致性和个体可辨识性上均有显著提升。
引用
@article{arxiv.2303.13843,
title = {CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout},
author = {Haotian Bai and Yuanhuiyi Lyu and Lutao Jiang and Sijia Li and Haonan Lu and Xiaodong Lin and Lin Wang},
journal= {arXiv preprint arXiv:2303.13843},
year = {2024}
}