中文

KALIE:无需机器人数据针对开放世界操控微调视觉-语言模型

机器人学 2024-09-24 v1 人工智能 机器学习

摘要

构建通用机器人系统需要有效地赋予机器人在开放世界环境中处理新物体的能力。受大型预训练模型进展的启发,我们提出了基于想象环境的关键点可供性学习,以可扩展的方式将预训练视觉语言模型适配于机器人控制。KALIE 不直接产生运动指令,而是基于自然语言指令和场景的视觉观测,通过预测基于点的可供性表示来控制机器人。该 VLM 在带有由人类标注可供性的 2D 图像上进行训练,免除了对机器人系统收集训练数据的需求。通过可供性感知数据合成流水线,KALIE 基于人类手动收集的有限示例数据,自动创建大量高质量训练数据。我们证明,仅给定 50 个示例数据点,KALIE 即可学习稳健地解决包含未见物体的新操控任务。与使用预训练 VLM 的基线相比,我们的方法持续取得更优的性能。

关键词

引用

@article{arxiv.2409.14066,
  title  = {KALIE: Fine-Tuning Vision-Language Models for Open-World Manipulation without Robot Data},
  author = {Grace Tang and Swetha Rajkumar and Yifei Zhou and Homer Rich Walke and Sergey Levine and Kuan Fang},
  journal= {arXiv preprint arXiv:2409.14066},
  year   = {2024}
}

备注

8 pages, 7 figures