中文

Human2Robot: 从配对的人类-机器人视频中学习机器人动作

机器人学 2025-11-18 v4

摘要

从人类演示中提炼知识是机器人学习与行动的有前景的方式. 现有方法通常依赖粗糙对齐的视频对, 仅局限于学习全局或任务级特征, 因而倾向于忽视复杂操作与对新任务的泛化所需的细粒度帧级动态. 我们认为这一局限性源于数据集与其所启发的方法之间的恶性循环. 为打破这一循环, 我们提出一种范式转变, 将细粒度的人类-机器人对齐视为条件视频生成问题. 为此, 我们首先引入 H&R, 一个新型第三人称数据集, 包含 2,600 期精确同步的人类与机器人运动, 通过 VR 远程操作系统收集. 随后, 我们呈现 Human2Robot 框架以利用此数据. Human2Robot 采用视频预测模型, 通过从人类输入生成机器人视频来学习机器人动力学的丰富且隐式表示, 从而指导解耦的动作解码器. 我们在真实世界的实验中展示, 该方法不仅在已见任务上实现高性能, 还在新位置、新物体、新实例乃至新任务类别上实现显著的零样本泛化.

关键词

引用

@article{arxiv.2502.16587,
  title  = {Human2Robot: Learning Robot Actions from Paired Human-Robot Videos},
  author = {Sicheng Xie and Haidong Cao and Zejia Weng and Zhen Xing and Haoran Chen and Shiwei Shen and Jiaqi Leng and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2502.16587},
  year   = {2025}
}