中文

WorldVLA:面向自回归动作世界模型的探索

机器人学 2025-06-27 v1 人工智能

摘要

我们提出了WorldVLA,这是一个统一动作与图像理解与生成的自回归动作世界模型。WorldVLA将Vision-Language-Action (VLA)模型与世界模型集成于单个框架中。该世界模型通过利用动作与图像理解,预测未来图像,以学习环境底层物理规律以提升动作生成效果。同时,动作模型基于图像观测生成后续动作,既辅助视觉理解,也有助于世界模型的视觉生成。我们展示了WorldVLA在独立的动作模型和世界模型方面均优于单独模型,凸显了世界模型与动作模型之间的相互增强。此外,我们发现当以自回归方式生成动作序列时,动作模型的性能会下降。这一现象可归因于模型对动作预测的泛化能力有限,导致早期动作的误差向后续动作传播。为解决此问题,我们提出一种注意力掩码策略,在生成当前动作时选择性地掩盖先前动作,该策略在动作块生成任务中显示出显著的性能提升。

关键词

引用

@article{arxiv.2506.21539,
  title  = {WorldVLA: Towards Autoregressive Action World Model},
  author = {Jun Cen and Chaohui Yu and Hangjie Yuan and Yuming Jiang and Siteng Huang and Jiayan Guo and Xin Li and Yibing Song and Hao Luo and Fan Wang and Deli Zhao and Hao Chen},
  journal= {arXiv preprint arXiv:2506.21539},
  year   = {2025}
}

备注

Code: https://github.com/alibaba-damo-academy/WorldVLA