中文

ImMimic:通过映射与插值实现人类视频的跨域模仿

机器人学 2025-09-16 v1

摘要

从丰富的人类视频中学习机器人操控提供了一个可扩展的替代方案,摆脱了昂贵的机器人专属数据收集。然而,跨越视觉、形态和物理等方面的 domain gap 阻碍了直接模仿。为有效桥接 domain gap,我们提出了 ImMimic,一种面向 embodiment-agnostic 的 co-training 框架,利用人类视频和少量遥操作机器人演示。ImMimic 使用 Dynamic Time Warping (DTW) 结合 action- 或 visual-based mapping 将 retargeted 人类手部姿态映射到机器人关节,然后在配对的人类和机器人轨迹之间进行 MixUp 插值。我们的关键洞察是 (1) retargeted 人类手部轨迹提供信息丰富的 action 标签,(2) 对映射后数据进行插值创建中间 domain,促进 co-training 中的平滑 domain adaptation。在四个真实世界操控任务 (Pick and Place、Push、Hammer、Flip) 以及四种机器人 embodiment (Robotiq、Fin Ray、Allegro、Ability) 上的评估表明,ImMimic 提升了任务成功率和执行平滑度,凸显了其桥接 domain gap 以实现稳健机器人操控的有效性。项目网址可在 https://sites.google.com/view/immimic 查找。

关键词

引用

@article{arxiv.2509.10952,
  title  = {ImMimic: Cross-Domain Imitation from Human Videos via Mapping and Interpolation},
  author = {Yangcen Liu and Woo Chul Shin and Yunhai Han and Zhenyang Chen and Harish Ravichandar and Danfei Xu},
  journal= {arXiv preprint arXiv:2509.10952},
  year   = {2025}
}

备注

Conference of Robot Learning