中文

MOKA:通过基于标记的视觉提示实现开放世界机器人操作

机器人学 2024-09-05 v3 人工智能

摘要

开放世界泛化要求机器人系统深入理解物理世界和用户指令,以解决多样且复杂的任务。虽然近期视觉语言模型(VLM)的进展为解决开放世界问题提供了前所未有的机会,但如何将其能力用于控制机器人仍是巨大挑战。本文引入MOKA(Marking Open-world Keypoint Affordances),一种利用VLM解决由自由形式语言指令指定的机器人操作任务的方法。我们方法的核心是一种紧凑的基于点的数据驱动表示,桥接了VLM对观测图像的预测与机器人在物理世界中的动作。通过对预训练VLM进行提示,我们利用其从广泛数据中获得的常识知识和概念理解能力,预测可行性并生成运动。为促进VLM以零样本和少样本方式进行推理,我们提出一种视觉提示技术,在图像上添加标记,将可行性推理转化为由VLM可解答的系列视觉问答问题。我们进一步探索了通过MOKA收集的机器人经验进行的情境学习和策略蒸馏以提升性能的方法。在包括工具使用、可变形物体操控和物体重排等多种桌面操作任务上,对MOKA进行了评估与分析。

关键词

引用

@article{arxiv.2403.03174,
  title  = {MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting},
  author = {Fangchen Liu and Kuan Fang and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:2403.03174},
  year   = {2024}
}