中文

NIL:利用预训练视频扩散模型实现无数据模仿学习

计算机视觉与模式识别 2025-03-14 v1 人工智能 机器学习 机器人学

摘要

在包括人形机器人、四足动物和动物在内的多样且非传统形态中获取物理上合理的运动技能,对推进角色仿真和机器人技术至关重要。传统方法如强化学习(RL)依赖特定任务和特定身体,需要大量奖励函数工程,且泛化能力差。模仿学习提供了一种替代方案,但严重依赖高质量专家示范,而这些示范对于非人类形态而言难以获取。另一方面,视频扩散模型能够生成各种形态的真实视频,从人类到蚂蚁。利用这一能力,我们提出一种不依赖数据的技能获取方法,通过二维生成视频学习三维运动技能,并具备向非传统和非人类形态泛化的能力。具体而言,我们通过计算视频嵌入之间的成对距离,利用视觉 Transformer 进行基于视频的比较来引导模仿学习过程。除了视频编码距离外,我们还使用分段视频帧之间的计算相似度作为引导奖励。我们在涉及独特身体配置的运动任务上验证了所提方法。在人形机器人运动任务中,我们证明'无数据模仿学习'(NIL)优于基于三维运动捕捉数据训练的基线方法。我们的结果展示了利用生成式视频模型进行物理合理技能学习的潜力,有效地用数据生成替代数据收集以实现模仿学习。

关键词

引用

@article{arxiv.2503.10626,
  title  = {NIL: No-data Imitation Learning by Leveraging Pre-trained Video Diffusion Models},
  author = {Mert Albaba and Chenhao Li and Markos Diomataris and Omid Taheri and Andreas Krause and Michael Black},
  journal= {arXiv preprint arXiv:2503.10626},
  year   = {2025}
}