中文

X-Humanoid:规模化生成类人机器人视频的机器人化人视频方法

计算机视觉与模式识别 2025-12-05 v1

摘要

具身人工智能的发展为智能人形机器人开辟了巨大的潜力。然而,面向Vision-Language-Action(VLA)模型和世界模型的进展,因缺乏大规模、多样化的训练数据而受到严重限制。一个有前景的解决方案是“机器人化”网络上规模的人类视频,这已被证明对政策训练有效。然而,这些解决方案主要是“叠加”机械臂到偶发视频,无法处理第三人称视频中复杂的全身动作和场景遮挡,因而不适用于机器人化人类。为弥合这一差距,我们引入X-Humanoid,这是一种生成式视频编辑方法,将强大的Wan 2.2模型适配为视频到视频结构,并微调以完成人类到类人机器人翻译任务。这种微调需要配对的人类-类人机器人视频,因此我们设计了一个可扩展的数据创建管道,将社区资源转化为17多个小时的配对合成视频。我们随后将训练好的模型应用于60小时的Ego-Exo4D视频中,生成并发布了超过360万帧“机器人化”人类视频帧。定量分析和用户研究确认了我们方法的优于现有基线方法的优势:69%的用户将其评为运动一致性最佳,62.1%评为本体正确性最佳。

关键词

引用

@article{arxiv.2512.04537,
  title  = {X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale},
  author = {Pei Yang and Hai Ci and Yiren Song and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2512.04537},
  year   = {2025}
}