视频生成器即机器人策略
机器人学
2025-08-04 v1
摘要
尽管在精细操作方面取得了显著进展,当前的视觉运动策略仍根本受限于两个挑战:它们在感知或行为分布迁移下难以泛化,其性能也受限于人类演示数据的规模。本文我们将视频生成用作机器人策略学习的代理,以同时解决这两个限制。我们提出了 Video Policy(视频策略),一个模块化框架,将视频生成和动作生成相结合,可端到端训练。我们的结果表明,学习生成机器人行为视频,允许从最小的演示数据中提取策略,显著提高鲁棒性和样本效率。我们的方法在仿真和实际环境中均对未见对象、背景和任务表现出强大的泛化能力。我们进一步指出,任务成功与生成视频紧密相关,提供无动作视频数据的无监督学习对针对新任务的泛化具有关键优势。通过利用大规模视频生成模型,我们的性能优于传统行为克隆,为更可扩展和数据高效的机器人策略学习铺平了道路。
引用
@article{arxiv.2508.00795,
title = {Video Generators are Robot Policies},
author = {Junbang Liang and Pavel Tokmakov and Ruoshi Liu and Sruthi Sudhakar and Paarth Shah and Rares Ambrus and Carl Vondrick},
journal= {arXiv preprint arXiv:2508.00795},
year = {2025}
}