中文

面向机器人世界模型的事件感知生成式世界模型:结构化的运动学到视觉动作场

计算机视觉与模式识别 2026-05-08 v1 人工智能 机器人学

摘要

预训练的视频扩散模型提供了强大的时空生成先验,因而是机器人世界模型的自然基础。虽然最近的 world-action 模型在联合优化未来视频和动作方面取得了进展,但它们主要将视频生成当作策略学习的辅助表示。 Consequently,they insufficiently explore the inverse problem: leveraging action signals to guide video synthesis, thereby often failing to preserve precise robot spatial geometry and fine-grained robot-object interaction dynamics in the generated rollouts. 为弥合这一差距,我们提出了 EA-WM,一个 Event-Aware Generative World Model,通过有效地关闭运动控制与视觉感知之间的循环。与此不同的是,不将关节或末端执行器动作作为抽象的、低维的 token 注入,而是将动作和运动学状态直接投影到目标相机视角中作为结构化的运动学到视觉动作场。为充分利用这一几何上 grounded 的表示,我们引入了 event-aware 双向融合模块,通过调制跨分支注意力,捕捉物体状态变化和相互作用动力学。我们在全面的 WorldArena 数据集上评估了 EA-WM,取得了显著优于现有基线的性能。

关键词

引用

@article{arxiv.2605.06192,
  title  = {EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields},
  author = {Zhaoyang Yang and Yurun Jin and Lizhe Qi and Cong Huang and Kai Chen},
  journal= {arXiv preprint arXiv:2605.06192},
  year   = {2026}
}

备注

Preprint. 22 pages, 10 figures