中文

VLMimic:视觉语言模型作为细粒度动作的视觉模仿学习器

机器人学 2024-11-01 v3

摘要

视觉模仿学习(VIL)为机器人系统获取新技能提供了一种高效且直观的策略。视觉语言模型(VLMs)的最新进展展示了其在 VIL 任务的视觉和语言推理能力方面的卓越性能。尽管取得了进展,当前的 VIL 方法天真地使用 VLMs 从人类视频中学习高层计划,依赖于预定义的运动原语来执行物理交互,这仍然是一个主要瓶颈。在这项工作中,我们提出了 VLMimic,这是一种利用 VLMs 直接学习甚至细粒度动作级别的新范式,仅需给定少量人类视频。具体而言,VLMimic 首先从人类视频中定位以对象为中心的运动,并使用层次约束表示学习技能,从而促进从有限的人类视频中推导出具有细粒度动作级别的技能。这些技能通过迭代比较策略进行精炼和更新,从而能够高效适应未见过的环境。我们的广泛实验表明,我们的 VLMimic 仅使用 5 个人类视频,在 RLBench 和真实世界操作任务中分别产生了超过 27% 和 21% 的显著提升,并在长时序任务中超越了基线 37% 以上。

关键词

引用

@article{arxiv.2410.20927,
  title  = {VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions},
  author = {Guanyan Chen and Meiling Wang and Te Cui and Yao Mu and Haoyang Lu and Tianxing Zhou and Zicai Peng and Mengxiao Hu and Haizhou Li and Yuan Li and Yi Yang and Yufeng Yue},
  journal= {arXiv preprint arXiv:2410.20927},
  year   = {2024}
}

备注

accepted for publication in the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)