中文

Soap2Soap:通过多智能体协作实现长篇电影级视频重制

计算机视觉与模式识别 2026-05-19 v1

摘要

我们研究了系列级电影级视频重制,这是一种长期视角到视角的生成问题,通过风格化或演员替换完全本地化剧集或电影,同时严格保持叙事结构、动作编排和角色身份跨数百个镜头。现有的视频生成和编辑管道在此情境下常因身份漂移、背景变异和语义退化而在大规模相机运动和视点变化下失效。我们提出Soap2Soap,一种多智能体框架,通过Dual-Bridge Consistency机制实现长期语言-视觉一致性:以场景感知 JSON 剧本作为持久语义骨架,以及在场景和镜头级别动态分配的视觉参考锚点。为抑制视频合成前的漂移,我们引入批量关键帧一致性,通过网格化表述在共享潜在上下文中联合生成多个关键帧。一个闭环验证智能体进一步审计身份、稳定性和对齐性,以触发选择性再生成。实验在 SoapBench 上表明,Soap2Soap 在长期一致性和叙事忠实度方面显著优于商业视频生成 API。

关键词

引用

@article{arxiv.2605.17423,
  title  = {Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration},
  author = {Yiren Song and Huilin Zhong and Kevin Qinghong Lin and Haofan Wang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2605.17423},
  year   = {2026}
}