中文

DoReMi:通过检测与恢复计划-执行失配实现语言模型落地

机器人学 2024-09-17 v4 人工智能

摘要

大语言模型(LLMs)编码了海量语义知识,并具备卓越的理解与推理能力。已有研究探索如何将 LLMs 落地于机器人任务以生成可行且可执行的文本计划。然而,由于环境扰动或控制器设计不完善,物理世界中的底层执行可能偏离高层文本计划。本文提出 \textbf{DoReMi},一种新颖的语言模型落地框架,能够即时检测并从计划与执行间的失配中恢复。具体而言,我们利用 LLMs 发挥双重作用,不仅辅助高层规划,还生成可在执行中指示失配的约束条件。随后利用视觉语言模型(VLMs)持续检测约束违反。我们的流程可监控底层执行,并在发生特定计划-执行失配时实现及时恢复。在包括机械臂与人形机器人在内的多种复杂任务上的实验表明,该方法可带来更高的任务成功率与更短的任务完成时间。DoReMi 的视频见 \url{https://sites.google.com/view/doremi-paper}。

关键词

引用

@article{arxiv.2307.00329,
  title  = {DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment},
  author = {Yanjiang Guo and Yen-Jen Wang and Lihan Zha and Jianyu Chen},
  journal= {arXiv preprint arXiv:2307.00329},
  year   = {2024}
}

备注

Published in IROS 2024