中文

面向机器人任务规划的视觉-语言解释器

机器人学 2024-02-21 v2 人工智能 计算与语言

摘要

大语言模型(LLMs)正加速语言引导的机器人规划器的发展。与此同时,符号规划器具有可解释性优势。本文提出一项桥接这两大趋势的新任务,即多模态规划问题规范生成。其目标是生成问题描述(PD)——一种供规划器寻找计划的机器可读文件。通过从语言指令与场景观测生成 PD,我们可在语言引导框架中驱动符号规划器。我们提出视觉-语言解释器(ViLaIn),一种利用最先进 LLM 与视觉-语言模型生成 PD 的新框架。ViLaIn 可通过符号规划器返回的错误信息反馈来精炼生成的 PD。我们的目的是回答如下问题:ViLaIn 与符号规划器生成有效机器人计划的准确度如何?为评估 ViLaIn,我们引入一个名为问题描述生成(ProDG)数据集的新数据集。该框架以四种新评价指标进行评估。实验结果表明,ViLaIn 生成语法正确问题的准确率超过 99%,生成有效计划的准确率超过 58%。我们的代码与数据集可在 https://github.com/omron-sinicx/ViLaIn 获取。

关键词

引用

@article{arxiv.2311.00967,
  title  = {Vision-Language Interpreter for Robot Task Planning},
  author = {Keisuke Shirai and Cristian C. Beltran-Hernandez and Masashi Hamaya and Atsushi Hashimoto and Shohei Tanaka and Kento Kawaharazuka and Kazutoshi Tanaka and Yoshitaka Ushiku and Shinsuke Mori},
  journal= {arXiv preprint arXiv:2311.00967},
  year   = {2024}
}

备注

ICRA 2024