中文

OK-Robot: 将开放知识模型集成到机器人技术中的关键要素

机器人学 2024-11-20 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

近年来,视觉、语言和机器人领域取得了显著进展。我们现在拥有能够根据语言查询识别物体的视觉模型,能够有效控制移动系统的导航系统,以及能够处理各种物体的抓取模型。尽管取得了这些进步,但机器人的通用应用仍然滞后,即使它们依赖于这些识别、导航和抓取的基本能力。在本文中,我们采用系统优先的方法,开发了一个新的基于开放知识的机器人框架,称为 OK-Robot。通过结合用于物体检测的视觉-语言模型、用于移动的导航原语和用于物体操作的抓取原语,OK-Robot 为拾取和放置操作提供了一个无需任何训练的集成解决方案。为了评估其性能,我们在 10 个真实世界的家庭环境中运行了 OK-Robot。结果表明,OK-Robot 在开放式拾取和放置任务中取得了 58.5% 的成功率,代表了开放词汇移动操作领域的最新水平,性能几乎是先前工作的 1.8 倍。在更干净、不杂乱的环境中,OK-Robot 的性能提升至 82%。然而,从 OK-Robot 中获得的最重要的见解是,在将视觉语言模型等开放知识系统与机器人模块结合时,细微的细节起着关键作用。我们的实验视频和代码可在我们的网站上获取:https://ok-robot.github.io

关键词

引用

@article{arxiv.2401.12202,
  title  = {OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics},
  author = {Peiqi Liu and Yaswanth Orru and Jay Vakil and Chris Paxton and Nur Muhammad Mahi Shafiullah and Lerrel Pinto},
  journal= {arXiv preprint arXiv:2401.12202},
  year   = {2024}
}

备注

Github repo: https://github.com/ok-robot/ok-robot