中文

ShareVerse:面向共享世界建模的多智能体一致视频生成

计算机视觉与模式识别 2026-03-04 v1 人工智能

摘要

本文提出ShareVerse,一个视频生成框架,实现多智能体共享世界建模,解决现有方法缺乏对多智能体交互统一共享世界构建支持的局限。ShareVerse利用大型视频模型的生成能力,集成三项关键创新:1)在CARLA仿真平台上构建大规模多智能体交互式世界建模数据集,包含多样场景、天气条件及交互轨迹,配套多视角视频(每个智能体前/后/左/右视角)和摄像头数据。2)提出四视角视频的空间拼接策略,用于建模更广阔环境,确保内部多视角几何一致性。3)将跨智能体注意力块集成到预训练视频模型中,实现跨智能体空间时间信息的交互传递,保证重叠区域的共享世界一致性及非重叠区域的合理生成。ShareVerse支持49帧大规模视频生成,准确感知动态智能体位置,实现一致的共享世界建模。

关键词

引用

@article{arxiv.2603.02697,
  title  = {ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling},
  author = {Jiayi Zhu and Jianing Zhang and Yiying Yang and Wei Cheng and Xiaoyun Yuan},
  journal= {arXiv preprint arXiv:2603.02697},
  year   = {2026}
}