中文

基于预训练大语言模型的层次化开放词汇室内场景合成

计算机视觉与模式识别 2025-02-18 v1

摘要

室内场景合成旨在自动生成合理、真实且多样的三维室内场景,特别是给定任意用户需求的情况下。最近,预训练大语言模型(LLM)的出色泛化能力有助于开放词汇室内场景合成。然而,挑战在于将LLM生成的输出转换为合理且物理可行的场景布局。在本文中,我们提出通过LLM生成层次化结构的场景描述,然后计算场景布局。具体而言,我们训练了一个层次感知网络来推断对象之间的细粒度相对位置,并设计了分治优化来求解场景布局。使用层次化场景表示的优势有两方面。首先,层次化结构为对象排列提供了粗略的基准,缓解了密集关系中的矛盾放置,并增强了网络推断细粒度放置的泛化能力。其次,它自然地支持分治优化,通过首先排列子场景然后排列整个场景,更有效地求解可行布局。我们进行了广泛的对比实验和消融研究,通过定性和定量评估验证了我们关键设计的有效性,即层次化场景表示。我们的方法可以生成更合理的场景布局,同时更好地对齐用户需求和LLM描述。我们还展示了开放词汇场景合成和交互式场景设计的结果,以展示我们方法在应用中的优势。

关键词

引用

@article{arxiv.2502.10675,
  title  = {Hierarchically-Structured Open-Vocabulary Indoor Scene Synthesis with Pre-trained Large Language Model},
  author = {Weilin Sun and Xinran Li and Manyi Li and Kai Xu and Xiangxu Meng and Lei Meng},
  journal= {arXiv preprint arXiv:2502.10675},
  year   = {2025}
}