中文

面向自动化推理的 3D 场景图结构化接口

计算机视觉与模式识别 2025-10-21 v1 人工智能 机器人学

摘要

为了使机器人能够理解并作出对用户自然语言输入的反应,必须将自然语言与机器人底层世界表示相联系。最近,大型语言模型 (LLM) 和 3D 场景图 (3DSG) 成为将自然语言锚定到世界表示中的热门选择。本文针对使用 LLM 与 3DSG 锚定自然语言的挑战进行了研究。现有方法将场景图编码为序列化文本置于 LLM 的上下文窗口中,但这种编码方式对大型或丰富的 3DSG 无法扩展。我们提出采用检索增强生成 (RAG) 的形式,从中选择与任务相关的子集。我们将 3DSG 编码为图数据库,并提供查询语言接口 (Cypher) 作为 LLM 的工具,以便其检索相关数据进行语言锚定。我们在指令跟随和场景问答任务上评估了该方法,并与基线上下文窗口和代码生成方法进行比较。我们的结果表明,使用 Cypher 作为 3D 场景图的接口在本地和云端模型上均能显著扩展到大型丰富图的规模。这在语言锚定任务中实现了显著的性能提升,同时大幅降低了场景图内容的 token 数量。附录中提供了视频 supplement 链接:https://www.youtube.com/watch?v=zY_YI9giZSA。

关键词

引用

@article{arxiv.2510.16643,
  title  = {Structured Interfaces for Automated Reasoning with 3D Scene Graphs},
  author = {Aaron Ray and Jacob Arkin and Harel Biggie and Chuchu Fan and Luca Carlone and Nicholas Roy},
  journal= {arXiv preprint arXiv:2510.16643},
  year   = {2025}
}

备注

25 pages, 3 figures