中文

ActionParty:生成视频游戏中的多主体动作绑定

计算机视觉与模式识别 2026-04-03 v1 人工智能 机器学习

摘要

近期视频扩散技术的进展使得“世界模型”能够模拟具有交互性的环境。然而,这些模型主要受限于单智能体设置,无法在场景中同时控制多个智能体。为此,我们聚焦视频扩散模型中动作绑定的根本问题——这些模型难以将特定动作与其对应的主体关联。为此,我们提出ActionParty,一个用于生成视频游戏的可控多主体世界模型。它引入主体状态记忆元(subject state tokens),即持续捕获场景中每个主体状态的潜在变量。通过以空间偏置机制联合建模状态记忆元和视频潜在表示,我们将全局视频帧渲染与单个动作控制的主体更新解耦。我们在Melting Pot基准测试上对ActionParty进行评估,展示了首个能在46个多样化环境中同时控制最高七名玩家的视频世界模型。我们的结果在动作跟随精度和身份一致性方面实现了显著提升,同时能够通过复杂交互实现主体的稳健自回归跟踪。

关键词

引用

@article{arxiv.2604.02330,
  title  = {ActionParty: Multi-Subject Action Binding in Generative Video Games},
  author = {Alexander Pondaven and Ziyi Wu and Igor Gilitschenski and Philip Torr and Sergey Tulyakov and Fabio Pizzati and Aliaksandr Siarohin},
  journal= {arXiv preprint arXiv:2604.02330},
  year   = {2026}
}

备注

Project page: https://action-party.github.io/