中文

FMimic: 基础模型是来自人类视频的细粒度动作学习者

机器人学 2025-07-29 v1

摘要

视觉模仿学习 (VIL) 为机器人系统获取新技能提供了一种高效且直观的策略。近期发展的基础模型,特别是视觉语言模型 (VLM),在VIL任务中展现出了在视觉和语言推理方面的显著能力。尽管已有进展,现有方法主要用于从人类演示中学习高层计划,依赖预定义的运动原语来执行物理交互,这仍是机器人系统的主要瓶颈。本文提出了FMimic—a一种新范例,利用基础模型直接在细粒度动作水平上学习可泛化的技能,只需少量人类视频。大量实验表明,我们的FMimic仅需一个人类视频即可获得卓越性能,五个视频时则显著优于所有其他方法。此外,我们的方法在RLBench多任务实验和真实世界操作任务中分别实现了超过39%和29%的显著提升,在高精度任务中超越基线34%以上,在长期程任务中超越基线47%以上。

关键词

引用

@article{arxiv.2507.20622,
  title  = {FMimic: Foundation Models are Fine-grained Action Learners from Human Videos},
  author = {Guangyan Chen and Meiling Wang and Te Cui and Yao Mu and Haoyang Lu and Zicai Peng and Mengxiao Hu and Tianxing Zhou and Mengyin Fu and Yi Yang and Yufeng Yue},
  journal= {arXiv preprint arXiv:2507.20622},
  year   = {2025}
}

备注

accepted to International Journal of Robotics Research(IJRR)