中文

PhiP-G:物理引导的文本到三维组合场景生成

计算机视觉与模式识别 2025-02-04 v1 人工智能

摘要

文本到三维资产生成在二维扩散先验的监督下已取得显著优化。然而,在处理组合场景时,现有方法遇到若干挑战:1) 无法确保组合场景布局符合物理规律;2) 难以准确捕捉复杂场景描述中描述的资产及其关系;3) 利用大语言模型(LLM)的布局方法自主资产生成能力有限。为避免这些妥协,我们提出了一个新颖的组合场景生成框架 PhiP-G,它无缝集成了生成技术与基于世界模型的布局引导。PhiP-G 利用基于 LLM 的智能体分析复杂场景描述以生成场景图,并整合多模态二维生成智能体与三维高斯生成方法进行目标资产创建。在布局阶段,PhiP-G 采用具有粘附能力的物理池和视觉监督智能体,形成一个用于布局预测和规划的世界模型。大量实验表明,PhiP-G 显著提升了组合场景的生成质量和物理合理性。值得注意的是,PhiP-G 在 CLIP 分数上达到了最先进(SOTA)性能,在 T3^3Bench 衡量的生成质量上与领先方法持平,并将效率提升了 24 倍。

关键词

引用

@article{arxiv.2502.00708,
  title  = {PhiP-G: Physics-Guided Text-to-3D Compositional Scene Generation},
  author = {Qixuan Li and Chao Wang and Zongjin He and Yan Peng},
  journal= {arXiv preprint arXiv:2502.00708},
  year   = {2025}
}

备注

13 pages.8 figures