中文

GVCCI:面向语言引导机器人操作的视觉定位终身学习

机器人学 2023-07-13 v1 计算机视觉与模式识别

摘要

语言引导机器人操作(LGRM)是一项具有挑战性的任务,因为它要求机器人理解人类指令以操控日常物体。LGRM的近期方法依赖预训练的视觉定位(VG)模型来检测物体,而未适应操作环境。由于预训练数据与真实世界数据之间存在显著的域差距,这导致性能下降。一种直接的解决方案是收集额外的训练数据,但人工标注的成本极其高昂。本文提出将视觉定位到持续生成的指令(GVCCI),一种用于LGRM的终身学习框架,其在无人工监督下持续学习VG。GVCCI通过目标检测迭代生成合成指令,并用生成的数据训练VG模型。我们在不同VG模型的多种环境的离线与在线设置中验证了框架。实验结果表明,从GVCCI累积合成数据可使VG稳定提升至多56.7%,并使 resultant LGRM提升至多29.4%。此外,定性分析显示,未适应的VG模型常因从预训练数据中学习的强偏差而无法找到正确物体。最后,我们引入了用于LGRM的新型VG数据集,包含来自多样操作环境的近252k个图像-物体-指令三元组。

关键词

引用

@article{arxiv.2307.05963,
  title  = {GVCCI: Lifelong Learning of Visual Grounding for Language-Guided Robotic Manipulation},
  author = {Junghyun Kim and Gi-Cheon Kang and Jaein Kim and Suyeon Shin and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:2307.05963},
  year   = {2023}
}

备注

Accepted at IROS2023