中文

面向复杂3D场景的场景图与布局引导生成

计算机视觉与模式识别 2024-12-31 v1

摘要

最近的基于对象的文本到3D生成技术取得了令人瞩目的成果。然而,由于对象之间关系的复杂性,生成复杂3D场景仍是一个未解决的挑战。此外,现有方法主要依赖得分蒸馏采样(SDS),限制了对具有特定相互作用的多对象进行操控的能力。针对这些尚未充分探索的关键问题,我们提出了一种新的框架:场景图与布局引导的3D场景生成(GraLa3D)。给定描述复杂3D场景的文本提示,GraLa3D利用大语言模型(LLM)以场景图表示形式建模,并包含布局边界框信息。GraLa3D独特地构建了包含单对象节点和复合超节点的场景图。除了将3D生成限制在理想布局内之外,主要贡献在于对超节点中对象之间相互作用的建模,同时减轻了此类节点内对象之间外观泄漏。我们的实验表明,GraLa3D克服了上述局限性,能够生成与文本提示高度一致的复杂3D场景。

关键词

引用

@article{arxiv.2412.20473,
  title  = {Toward Scene Graph and Layout Guided Complex 3D Scene Generation},
  author = {Yu-Hsiang Huang and Wei Wang and Sheng-Yu Huang and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2412.20473},
  year   = {2024}
}

备注

13 pages, 12 figures