LLM-GROP:基于大语言模型的视觉 grounding 机器人任务与运动规划
机器人学
2025-11-12 v1
摘要
任务规划与运动规划是机器人学中的两个关键问题,任务规划方法帮助机器人实现高层目标,而运动规划方法确保低层可行性。任务与运动规划 (TAMP) 方法交替进行这两个过程,以确保目标实现和运动可行性。在 TAMP 上下文中,我们关注的是多个物体的移动操作 (mobile manipulation, MoMa),需要交替进行导航和操作动作。特别地,我们旨在计算每个物体应放置的地点和方式,给定不完全指定的目标,如“用叉子、刀和盘子摆设晚餐桌”。我们利用大语言模型 (LLM) 提供的丰富常识知识(例如关于餐具如何组织的方式),以促进任务层面和运动层面的规划。此外,我们使用计算机视觉方法学习一种用于选择基座位置的策略,以促进 MoMa 行为,其中基座位置对应于机器人在其操作空间中的“足迹”和朝向。总体而言,本文为 MoMa 任务提供了一种原则性的 TAMP 框架,考虑了物体重新布置的常识,并适应包括大量需移动物体的新情况。我们在真实环境和模拟环境中进行了定量实验。我们评估了完成长期程物体重新布置任务的成功率和效率。尽管机器人完成了84.4%的真实环境物体重新布置试验,但主观的人类评估表明,机器人的性能仍低于有经验的服务生。
关键词
引用
@article{arxiv.2511.07727,
title = {LLM-GROP: Visually Grounded Robot Task and Motion Planning with Large Language Models},
author = {Xiaohan Zhang and Yan Ding and Yohei Hayamizu and Zainab Altaweel and Yifeng Zhu and Yuke Zhu and Peter Stone and Chris Paxton and Shiqi Zhang},
journal= {arXiv preprint arXiv:2511.07727},
year = {2025}
}