中文

EmbodiedRAG:面向高效可扩展机器人任务规划的动态3D场景图检索

机器人学 2024-11-01 v1

摘要

大型语言模型(LLMs)的最新进展有助于推动机器人在真实开放世界环境中规划的激动人心的进展。3D场景图(3DSGs)为基于LLM的规划器提供了一种有前景的环境表示,因为它们紧凑且语义丰富。然而,随着机器人环境的规模扩大(例如,跟踪的实体数量)和场景图信息复杂性的增加(例如,维护更多属性),由于输入令牌数量限制和LLM中存在的注意力偏差,将3DSG原样提供给基于LLM的规划器很快变得不可行。受检索增强生成(RAG)方法成功地为LLM问答检索与查询相关的文档块的启发,我们将该范式应用于我们的具身领域。具体来说,我们提出了一个名为EmbodiedRAG的3D场景子图检索框架,并用它来增强基于LLM的规划器,以执行自然语言机器人任务。值得注意的是,我们检索的子图能适应环境的变化以及机器人执行计划时任务相关性的变化。我们展示了EmbodiedRAG在AI2Thor模拟家务任务中,使用单臂移动机械臂,显著减少输入令牌数量(一个数量级)和规划时间(每个规划步骤的平均时间最多减少70%),同时提高了成功率。此外,我们在一个带机械臂的四足机器人上实现了EmbodiedRAG,以突出在真实环境边缘部署机器人的性能优势。

关键词

引用

@article{arxiv.2410.23968,
  title  = {EmbodiedRAG: Dynamic 3D Scene Graph Retrieval for Efficient and Scalable Robot Task Planning},
  author = {Meghan Booker and Grayson Byrd and Bethany Kemp and Aurora Schmidt and Corban Rivera},
  journal= {arXiv preprint arXiv:2410.23968},
  year   = {2024}
}