MimicDreamer:面向可扩展 VLA 训练的人类与机器人演示对齐
机器人学
2025-09-30 v2 人工智能
摘要
视觉语言动作 (VLA) 模型的泛化能力来源于多样化训练数据,但收集具身机器人互动数据仍昂贵。相比之下,人类演示视频更易获取且成本更低,近期研究证实其在训练 VLA 模型方面的有效性。然而,人类视频与机器人执行视频之间仍存在显著的 domain gap,包括不稳定的摄像机视角、人类手部与机器人机臂之间的视觉差异,以及运动动力学差异。为弥合这一差距,我们提出 MimicDreamer,一个将快速、低成本的人类演示转化为机器人可用监督信号的框架,通过联合对齐视觉、视角和动作,直接支持策略训练。对于视觉对齐,我们提出 H2R Aligner,一种视频扩散模型,通过传递人类操纵影片的动作生成高保真度机器人演示视频。对于视角稳定,提出 EgoStabilizer,通过单矩哈利克仿制第一人称视频,并对遮挡和扭曲进行插值。对于动作对齐,我们将人类手部轨迹映射到机器人坐标系,并应用受约束的逆运动学求解器生成可行、低抖动的关节命令,确保精确姿态跟踪。经验上,仅使用我们合成的人类到机器人视频训练的 VLA 模型可实现真实机器人上的 few-shot 执行。此外,与仅使用真实机器人数据训练的模型相比,我们的方法在六个典型操纵任务上的平均成功率提升 14.7%。
引用
@article{arxiv.2509.22199,
title = {MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training},
author = {Haoyun Li and Ivan Zhang and Runqi Ouyang and Xiaofeng Wang and Zheng Zhu and Zhiqin Yang and Zhentao Zhang and Boyuan Wang and Chaojun Ni and Wenkang Qin and Xinze Chen and Yun Ye and Guan Huang and Zhenbo Song and Xingang Wang},
journal= {arXiv preprint arXiv:2509.22199},
year = {2025}
}