基于多视角视频生成的端到端策略学习:动作图像
计算机视觉与模式识别
2026-04-16 v2 机器人学
摘要
世界动作模型(WAM)已成为机器人策略学习的有前景方向,因其能够利用强大的视频背板来建模未来状态。然而,现有方法常依赖独立的动作模块,或使用非像素锚定的动作表示,限制了充分利用预训练视频模型的知识,并限制了跨视角和跨环境的迁移能力。本文提出动作图像(Action Images),一种统一的世界动作模型,将策略学习形式化为多视角视频生成。我们不将控制编码为低维标记,而是将7自由度机器人动作翻译为可解释的动作图像:以2D像素为基础并显式跟踪机器人机臂运动的多视角动作视频。这种像素锚定的动作表示允许视频背板本身作为零样本策略器,无需额外的策略头或动作模块。除了控制,该统一模型还支持视频-动作联合生成、动作条件视频生成和动作标注,所有功能均基于共享表示。通过在RLBench和真实环境中的评估,我们的模型实现了最强的零样本成功率,并在先前视频空间世界模型基础上提高了视频-动作联合生成质量,表明可解释的动作图像是策略学习的有前景路径。
引用
@article{arxiv.2604.06168,
title = {Action Images: End-to-End Policy Learning via Multiview Video Generation},
author = {Haoyu Zhen and Zixian Gao and Qiao Sun and Yilin Zhao and Yuncong Yang and Yilun Du and Pengsheng Guo and Tsun-Hsuan Wang and Yi-Ling Qiao and Chuang Gan},
journal= {arXiv preprint arXiv:2604.06168},
year = {2026}
}
备注
Project Page: https://actionimages.github.io/