中文

SceneWeaver: 基于可扩展与自反思智能体的全合一 3D 场景合成

图形学 2025-10-28 v2 计算机视觉与模式识别 机器学习 机器人学

摘要

随着具身 AI 的兴起,室内场景合成变得越来越重要,这需要不仅视觉上真实而且物理上合理、功能上多样的 3D 环境。虽然近期方法在视觉保真度方面取得了进展,但它们通常受限于固定的场景类别,缺乏足够的物体级细节和物理一致性,并且难以与复杂用户指令对齐。在这项工作中,我们提出了 SceneWeaver,一个基于智能体的反射性框架,通过基于工具的迭代优化统一了多样化的场景合成范式。SceneWeaver 的核心是一个基于语言模型的规划器,它从一套可扩展的场景生成工具中进行选择,涵盖从数据驱动的生成模型到基于视觉和 LLM 的方法,其指导来自对物理合理性、视觉真实性和与用户输入语义对齐的自评估。这种闭环的推理-行动-反思设计使智能体能够识别语义不一致性、调用针对性工具,并在连续迭代中更新环境。在常见和开放词汇房间类型上的广泛实验表明,SceneWeaver 不仅在物理、视觉和语义指标上优于先前方法,而且能有效泛化到具有多样化指令的复杂场景,标志着迈向通用 3D 环境生成迈出了重要一步。项目网站:https://scene-weaver.github.io/

关键词

引用

@article{arxiv.2509.20414,
  title  = {SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent},
  author = {Yandan Yang and Baoxiong Jia and Shujie Zhang and Siyuan Huang},
  journal= {arXiv preprint arXiv:2509.20414},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025, 26 pages