基于大语言模型的具身任务规划
计算机视觉与模式识别
2023-07-07 v1 人工智能
机器人学
摘要
为具身智能体配备常识对于机器人在通用环境中成功完成复杂人类指令十分重要。近期大语言模型(LLM)可为智能体的复杂任务规划生成嵌入丰富语义知识,但它们缺乏关于真实世界的信息,通常产生不可行的动作序列。本文提出一种用于具身任务的带物理场景约束的接地规划 TAsk Planing Agent(TaPA),该智能体通过使LLM与视觉感知模型对齐,根据场景中已有物体生成可执行规划。具体而言,我们首先构建包含室内场景、指令和动作规划三元组的多模态数据集,其中我们为 GPT-3.5 提供设计的提示与场景中已有物体列表以生成大量指令及对应规划动作。所生成数据用于预训练LLM的接地规划微调。推理时,我们通过将开放词汇目标检测器扩展到在不同可达位置采集的多视角RGB图像来发现场景中的物体。实验结果表明,我们的TaPA框架生成的规划比 LLaVA 和 GPT-3.5 以可观优势取得更高成功率,这表明具身任务规划在通用复杂环境中的实用性。
引用
@article{arxiv.2307.01848,
title = {Embodied Task Planning with Large Language Models},
author = {Zhenyu Wu and Ziwei Wang and Xiuwei Xu and Jiwen Lu and Haibin Yan},
journal= {arXiv preprint arXiv:2307.01848},
year = {2023}
}
备注
Project Page: https://gary3410.github.io/TaPA