中文

INVIGORATE:杂乱环境中的交互式视觉指代与抓取

机器人学 2024-01-09 v2 人工智能

摘要

本文提出了 INVIGORATE,这是一个通过自然语言与人交互并在杂乱环境中抓取指定物体的机器人系统。物体之间可能相互遮挡、阻碍甚至堆叠。INVIGORATE 包含几项挑战: 从输入的语言表达和 RGB 图像中推断被其他遮挡物体包围的目标物体; 从图像中推断物体阻挡关系(OBRs); 综合多步规划以提出消除目标物体歧义的问题并成功将其抓取。我们分别训练了用于目标检测、视觉指代、问题生成以及 OBR 检测与抓取的独立神经网络。在训练数据集的约束下,它们允许不受限制的物体类别和语言表达。然而,视觉感知中的误差和人类语言的歧义是不可避免的,会对机器人的性能产生负面影响。为了克服这些不确定性,我们构建了一个集成已学习神经网络模块的部分可观测马尔可夫决策过程(POMDP)。通过近似 POMDP 规划,机器人跟踪观测历史并提出消除歧义的问题,以实现识别和抓取目标物体的近优动作序列。INVIGORATE 结合了基于模型的 POMDP 规划与数据驱动的深度学习的优势。在 Fetch 机器人上使用 INVIGORATE 进行的初步实验表明,这种集成方法对于在自然语言交互下进行杂乱环境中的物体抓取具有显著优势。演示视频可在 https://youtu.be/zYakh80SGcU 获取。

关键词

引用

@article{arxiv.2108.11092,
  title  = {INVIGORATE: Interactive Visual Grounding and Grasping in Clutter},
  author = {Hanbo Zhang and Yunfan Lu and Cunjun Yu and David Hsu and Xuguang Lan and Nanning Zheng},
  journal= {arXiv preprint arXiv:2108.11092},
  year   = {2024}
}

备注

12 pages, full version