中文

MimicDroid:基于人类游戏视频的仿人机器人操作上下文学习

机器人学 2025-09-15 v1

摘要

我们旨在使仿人机器人能够从少量视频示例中高效解决新的操作任务。上下文学习 (ICL) 因其测试时的数据效率与快速适应能力,成为实现这一目标的有前景的框架。然而,当前的 ICL 方法依赖于费力的遥操作数据进行训练,这限制了可扩展性。我们提出使用人类游戏视频——人们自由与环境交互的连续、无标注视频——作为可扩展且多样的训练数据源。我们引入了 MimicDroid,它使仿人机器人能够仅使用人类游戏视频作为训练数据来执行 ICL。MimicDroid 提取具有相似操作行为的轨迹对,并训练策略以一条轨迹为条件预测另一条轨迹的动作。通过这一过程,模型获得了在测试时适应新物体与环境的 ICL 能力。为弥合具身差异,MimicDroid 首先利用运动学相似性,将基于 RGB 视频估计的人类腕部姿态重定向至仿人机器人。它还在训练期间应用随机块掩码,以减少对人类特定线索的过拟合并提高对视觉差异的鲁棒性。为评估仿人机器人的少样本学习,我们引入了一个开源仿真基准,其泛化难度逐级递增。MimicDroid 优于 SOTA 方法,并在真实世界中实现了近两倍的成功率。更多材料请见:ut-austin-rpl.github.io/MimicDroid

关键词

引用

@article{arxiv.2509.09769,
  title  = {MimicDroid: In-Context Learning for Humanoid Robot Manipulation from Human Play Videos},
  author = {Rutav Shah and Shuijing Liu and Qi Wang and Zhenyu Jiang and Sateesh Kumar and Mingyo Seo and Roberto Martín-Martín and Yuke Zhu},
  journal= {arXiv preprint arXiv:2509.09769},
  year   = {2025}
}

备注

11 pages, 9 figures, 5 tables