基于大模型的指令引导操作可及性学习用于具身机器人任务
机器人学
2024-08-27 v1
摘要
我们研究了语言指令引导的机器人操作任务,即具身机器人应根据语言指令来操作目标物体。在以往的研究中,目标物体的预测操作区域通常不随语言指令的指定而改变,这意味着语言感知与操作预测是分离的。然而,在人类行为模式中,同一物体在不同语言指令下的操作区域会发生变化。在本文中,我们提出了指令引导可及性网络(IGANet),利用在大规模数据集上预训练的视觉和语言编码器的强大先验知识,来预测指令引导机器人操作任务中的可及性图。我们开发了一种基于视觉-语言模型(VLMs)的数据增强流水线,可以自动生成大量数据用于模型训练。此外,借助大语言模型(LLMs),可以有效执行动作来完成指令定义的任务。一系列真实世界实验表明,我们的方法利用生成数据取得了更好的性能。此外,我们的模型在未见物体和语言指令的场景中具有更好的泛化能力。
引用
@article{arxiv.2408.10658,
title = {Learning Instruction-Guided Manipulation Affordance via Large Models for Embodied Robotic Tasks},
author = {Dayou Li and Chenkun Zhao and Shuo Yang and Lin Ma and Yibin Li and Wei Zhang},
journal= {arXiv preprint arXiv:2408.10658},
year = {2024}
}
备注
Accepted to ICARM 2024