中文

视频预测策略:一种具备预测视觉表征的通用机器人策略

计算机视觉与模式识别 2025-05-06 v2 机器人学

摘要

视觉表征在开发通用机器人策略方面起着关键作用。以往的视觉编码器通常通过单图像重建或两图像对比学习进行预训练,倾向于捕捉静态信息,往往忽视构成具身任务所必需的动态方面。最近的视频扩散模型(VDM)表现出预测未来帧并展现对物理世界深入理解的能力。我们假设VDM天然产生的视觉表征包含当前静态信息和预测未来动态,从而为机器人动作学习提供有价值的指导。基于此假设,我们提出了视频预测策略(VPP),其学习了基于VDM中预测未来表征的隐式逆动力学模型。为预测更精确的未来,我们在机器人数据集上对预训练的视频基础模型进行微调,并融合来自互联网人类操作数据的信息。实验表明,VPP在卡尔文ABC-D泛化基准测试中相较于前沿方法实现了18.6%的相对提升,在复杂真实世界灵巧操作任务中成功率提升了31.6%。项目页面可访问于https://video-prediction-policy.github.io

关键词

引用

@article{arxiv.2412.14803,
  title  = {Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations},
  author = {Yucheng Hu and Yanjiang Guo and Pengchao Wang and Xiaoyu Chen and Yen-Jen Wang and Jianke Zhang and Koushil Sreenath and Chaochao Lu and Jianyu Chen},
  journal= {arXiv preprint arXiv:2412.14803},
  year   = {2025}
}

备注

ICML 2025 Spotlight Paper. The first two authors contribute equally