中文

PlaySlot:用于可控对象-centric 视频预测与规划的逆潜在动力学学习方法

计算机视觉与模式识别 2025-05-22 v2 机器人学

摘要

预测未来场景表示是使机器人理解与与环境交互的关键任务。然而,大多数现有方法依赖带有精确动作标注的视频和仿真数据,限制了其利用大量无标签视频数据的能力。为此,我们提出了 PlaySlot,一种基于对象的视频预测模型,从无标签视频序列中推断对象表示和潜在动作。随后利用这些表示来预测未来对象状态和视频帧。PlaySlot 允许根据潜在动作生成多个可能的未来情景,这些动作可以从视频动力学中推断得出,或由用户提供,或由学习的动作策略生成,从而实现灵活且可解释的世界建模。我们的实验结果表明,PlaySlot 在不同环境下的视频预测任务中优于基于概率模型和基于对象的基线方法。此外,我们展示了推断得到的潜在动作可用于从无标签视频演示中高效学习机器人行为。视频与代码已在 https://play-slot.github.io/PlaySlot/ 提供。

关键词

引用

@article{arxiv.2502.07600,
  title  = {PlaySlot: Learning Inverse Latent Dynamics for Controllable Object-Centric Video Prediction and Planning},
  author = {Angel Villar-Corrales and Sven Behnke},
  journal= {arXiv preprint arXiv:2502.07600},
  year   = {2025}
}

备注

ICML 2025