中文

H2R-Grounder:一种无需配对数据的数据驱动方法,用于将人类交互视频翻译为物理驱动的机器人视频

机器人学 2025-12-11 v1 人工智能 计算机视觉与模式识别

摘要

从日常人类视频中学习操控技能的机器人能够获取广泛的能力,而无需繁琐的机器人数据收集。我们提出一种视频到视频的翻译框架,将普通的人类-物体交互视频转换为具有运动一致性和真实物理驱动交互的机器人操控视频。该方法无需任何配对的人类-机器人视频训练,仅需一组无配对的机器人视频,即可实现系统规模化。我们引入一种可迁移的表示方法,弥合本体差距:通过在训练视频中对机器人臂进行插值处理以获得干净的背景,并在其上叠加简单视觉提示(标记和箭头指示机械手的位置和姿态),我们可以将机器人臂重新嵌入场景中。在测试时,我们对人类视频执行相同的处理过程(对人物进行插值并叠加人体姿态提示),从而生成高质量的机器人视频,模拟人类的动作。我们以微调SOTA视频扩散模型(Wan 2.2)的方式进行上下文学习,以确保时间一致性并利用其丰富的先验知识。实验结果表明,我们的方法相对于基线方法实现了显著更真实和更物理驱动的机器人动作,指向了以无标签人类视频扩展机器人学习的可行方向。项目页面:https://showlab.github.io/H2R-Grounder/

关键词

引用

@article{arxiv.2512.09406,
  title  = {H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos},
  author = {Hai Ci and Xiaokang Liu and Pei Yang and Yiren Song and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2512.09406},
  year   = {2025}
}

备注

13 pages, 6 figures