VILP:基于潜在视频规划的模仿学习
机器人学
2025-02-05 v1 计算机视觉与模式识别
摘要
在生成式人工智能时代,将视频生成模型集成到机器人技术中,为通用机器人智能体开辟了新的可能性。本文介绍了基于潜在视频规划的模仿学习(VILP)。我们提出了一种潜在视频扩散模型,用于生成在相当程度上符合时间一致性的预测性机器人视频。我们的方法能够生成来自多个视角的高度时间对齐的视频,这对机器人策略学习至关重要。我们的视频生成模型具有很高的时间效率。例如,它可以以 5 Hz 的速率从两个不同视角生成视频,每个视频包含六帧,分辨率为 96x160 像素。在实验中,我们证明 VILP 在训练成本、推理速度、生成视频的时间一致性以及策略性能等多个指标上均优于现有的视频生成机器人策略。我们还将我们的方法与其他模仿学习方法进行了比较。我们的研究结果表明,VILP 可以在较少依赖大量高质量、特定任务的机器人动作数据的情况下,仍保持稳健的性能。此外,VILP 在表示多模态动作分布方面具有强大的能力。我们的论文提供了一个如何将视频生成模型有效集成到机器人策略中的实际案例,可能为相关领域和方向提供见解。更多细节,请参阅我们的开源代码库 https://github.com/ZhengtongXu/VILP。
引用
@article{arxiv.2502.01784,
title = {VILP: Imitation Learning with Latent Video Planning},
author = {Zhengtong Xu and Qiang Qiu and Yu She},
journal= {arXiv preprint arXiv:2502.01784},
year = {2025}
}