中文

EmbodiedGPT:通过具身思维链进行视觉-语言预训练

机器人学 2023-09-15 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

具身AI是机器人学的关键前沿,能够规划并执行动作序列以使机器人在物理环境中完成长程任务。本工作中,我们提出EmbodiedGPT,一个用于具身AI的端到端多模态基础模型,赋予具身智能体多模态理解与执行能力。为此,我们做出以下努力:(i)我们构建了一个大规模具身规划数据集,称为EgoCOT。该数据集由从Ego4D数据集中精心筛选的视频及相应高质量语言指令组成。具体而言,我们以“思维链”模式生成子目标序列以实现有效具身规划。(ii)我们向EmbodiedGPT引入一种高效训练方法,通过前缀调优将7B大语言模型(LLM)适配到EgoCOT数据集以生成高质量规划。(iii)我们引入一种从LLM生成规划查询中提取任务相关特征的范式,以形成高层规划与低层控制间的闭环。大量实验表明EmbodiedGPT在具身任务上的有效性,包括具身规划、具身控制、视觉描述和视觉问答。值得注意的是,EmbodiedGPT通过提取更有效特征显著提升了具身控制任务的成功率。相比用Ego4D数据集微调的BLIP-2基线,其在Franka Kitchen基准上成功率提升达1.6倍,在Meta-World基准上提升达1.3倍。

关键词

引用

@article{arxiv.2305.15021,
  title  = {EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought},
  author = {Yao Mu and Qinglong Zhang and Mengkang Hu and Wenhai Wang and Mingyu Ding and Jun Jin and Bin Wang and Jifeng Dai and Yu Qiao and Ping Luo},
  journal= {arXiv preprint arXiv:2305.15021},
  year   = {2023}
}