中文

SceneLCM:基于潜在一致性模型的面向布局引导的端到端室内场景生成

计算机视觉与模式识别 2025-06-10 v1

摘要

我们的项目页面:https://scutyklin.github.io/SceneLCM/。自动生成量身定制用户提示的复杂、交互式室内场景 remains a formidable challenge。虽然现有方法实现了室内场景合成,但它们在刚性编辑约束、物理不一致性、人力过度消耗、单房间限制以及次优材料质量方面存在困难。为解决这些限制,我们提出SceneLCM,一个将大语言模型(LLM)用于布局设计与潜在一致性模型(LCM)用于场景优化相结合的端到端框架。我们的方法将场景生成分解为四个模块化管道:(1)布局生成。我们采用LLM引导的3D空间推理,将文本描述转换为参数蓝图(3D布局)。并通过LLM中介的对话循环迭代细化布局参数;(2)家具生成。SceneLCM采用一致性蒸馏抽样(CTS),该方法由LCM指导下的一致性蒸馏损失构成,形成快速的、语义丰富且高质量的表示。我们还提供两种理论依据,表明我们的CTS损失等价于一致性损失,其蒸馏误差受欧拉求解器截断误差的上界控制;(3)环境优化。我们使用多分辨率纹理场对场景外观进行编码,通过CTS损失进行优化。为维持跨几何纹理一致性,我们引入正规-aware的跨注意解码器,通过对几何异构实例中锚定位置的跨注意预测RGB;(4)物理编辑。SceneLCM通过集成物理仿真实现物理编辑,确保持久的物理真实性。大量实验表明,SceneLCM在当前最先进技术之上具有优势,显示出其在多样化应用中的广泛潜力。

关键词

引用

@article{arxiv.2506.07091,
  title  = {SceneLCM: End-to-End Layout-Guided Interactive Indoor Scene Generation with Latent Consistency Model},
  author = {Yangkai Lin and Jiabao Lei and Kui Jia},
  journal= {arXiv preprint arXiv:2506.07091},
  year   = {2025}
}