中文

Mitty:基于扩散的 人类到机器人视频生成

计算机视觉与模式识别 2025-12-22 v1

摘要

直接从人类演示视频学习是通用机器人学习不可或缺的里程碑。然而现有方法依赖关键点或轨迹等中间表示,导致信息丢失和累积误差,损害时序和视觉一致性。我们提出 Mitty,一种 Diffusion Transformer,实现视频 In-Context Learning,用于 end-to-end Human2Robot 视频生成。基于预训练视频扩散模型,Mitty 利用强大的视觉时序先验,将人类演示翻译为机器人执行视频,无需动作标签或中间抽象。演示视频被压缩为 condition tokens,并通过扩散过程中的双向注意力与机器人 denoising tokens 融合。为缓解配对数据稀缺,我们还开发了自动合成管道,从大型第三人称数据集中生成高质量的人类-机器人配对。在 Human2Robot 和 EPIC-Kitchens 上的实验表明,Mitty 达到了最先进的成果,展现了对未见环境的强大泛化能力,并为从人类观察中进行可扩展机器人学习提供了新见解。

关键词

引用

@article{arxiv.2512.17253,
  title  = {Mitty: Diffusion-based Human-to-Robot Video Generation},
  author = {Yiren Song and Cheng Liu and Weijia Mao and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2512.17253},
  year   = {2025}
}