中文

使用预训练视觉-语言模型的开放世界物体操控

机器人学 2023-10-27 v2 人工智能 计算机视觉与模式识别

摘要

为了让机器人能够遵循人的指令,它们必须能够将人类词汇中的丰富语义信息(例如“你能给我拿那只粉色毛绒鲸鱼吗?”)与其感官观测和动作联系起来。这给机器人带来了一个显著困难的挑战:尽管机器人学习方法允许机器人从第一手经验中学习许多不同行为,但让机器人拥有涵盖所有此类语义信息的第一手经验是不切实际的。我们希望机器人的策略能够感知并捡起粉色毛绒鲸鱼,即使它以前从未见过任何与毛绒鲸鱼交互的数据。幸运的是,互联网上的静态数据具有海量语义信息,且这些信息被捕获在预训练的视觉-语言模型中。本文中,我们研究是否可以将机器人策略与这些预训练模型对接,旨在让机器人完成涉及其从未第一手见过的物体类别的指令。我们开发了一种简单方法,称为开放世界物体操控(MOO),它利用预训练视觉-语言模型从语言指令和图像中提取物体识别信息,并基于当前图像、指令和提取的物体信息来条件化机器人策略。在真实移动操控器的多种实验中,我们发现 MOO 对广泛的新颖物体类别和环境实现了零样本泛化。此外,我们展示了 MOO 如何泛化到其他非语言输入的模态来指定感兴趣物体(如手指指向),以及如何进一步扩展以实现开放世界导航与操控。项目网站和评估视频可在 https://robot-moo.github.io/ 找到。

关键词

引用

@article{arxiv.2303.00905,
  title  = {Open-World Object Manipulation using Pre-trained Vision-Language Models},
  author = {Austin Stone and Ted Xiao and Yao Lu and Keerthana Gopalakrishnan and Kuang-Huei Lee and Quan Vuong and Paul Wohlhart and Sean Kirmani and Brianna Zitkovich and Fei Xia and Chelsea Finn and Karol Hausman},
  journal= {arXiv preprint arXiv:2303.00905},
  year   = {2023}
}

备注

Accepted at the 7th Conference on Robot Learning (CoRL 2023)