中文

基于关系场景图的自然语言命令对象定位

机器人学 2026-02-05 v1

摘要

机器人正在广泛应用于人类环境中,增加了对自然人机交互的需求。然而,理解自然语言命令需要机器人推断其意图任务,并将其分解为可执行动作,同时将这些动作在机器人对环境的认知中进行定位,包括相关对象、代理人和位置。可以采用将大型语言模型(LLM)的理解自然语言能力与 3D 场景图(3DSG)结合起来,将推断的动作锚定到环境语义表示中。然而,许多 3DSG 缺乏对象之间明确的空间关系,尽管人类常依赖这些关系来描述环境。本文研究了将开放词汇或封闭词汇空间关系整合到 3DSG 中,是否可以提高 LLM 解释自然语言命令的能力。为此,我们提出了一种基于 LLM 的管道,用于从开放词汇语言命令中进行目标对象定位,以及一种基于视觉语言模型(VLM)的管道,从机器人捕获的图像中为 3DSG 添加开放词汇空间边。最后评估了两种 LLM 在下游目标对象定位任务中的性能。我们的研究表明,明确的空间关系可以提高 LLM 将对象锚定的能力。此外,开放词汇关系生成使用 VLM 从机器人捕获的图像中实现可行,但其优于封闭词汇关系的优势有限。

关键词

引用

@article{arxiv.2602.04635,
  title  = {Relational Scene Graphs for Object Grounding of Natural Language Commands},
  author = {Julia Kuhn and Francesco Verdoja and Tsvetomila Mihaylova and Ville Kyrki},
  journal= {arXiv preprint arXiv:2602.04635},
  year   = {2026}
}

备注

In review for RA-L