中文

MV-S2V:多视角主体一致视频生成

计算机视觉与模式识别 2026-05-05 v3 人工智能 图形学

摘要

现有的主体到视频生成 (Subject-to-Video Generation, S2V) 方法已实现高保真度和主体一致的视频生成,但受限于单视角主体参考。这一限制将 S2V 任务简化为 S2I + I2V 流水线,未能发挥视频主体控制的潜力。本文提出并解决了具有挑战性的多视角 S2V (MV-S2V) 任务,该任务从多个参考视角合成视频,以实现 3D 级别的主体一致性。鉴于训练数据的稀缺,我们首先开发了合成数据 curated pipeline 来生成高度定制的合成数据,并辅以小规模的真实世界捕获数据集以提升 MV-S2V 的训练。另一个关键问题在于条件生成中可能出现的跨主体与跨视角参考混淆。为克服这一问题,我们进一步引入了时间偏移旋转位置编码 (Temporally Shifted RoPE, TS-RoPE) 以区分不同主体以及同一主体的不同视角在参考条件中的作用。我们的框架在多视角参考图像的 3D 主体一致性方面优于现有方法,并产生高质量的视觉输出,确立了主体驱动视频生成的新意义方向。代码和数据可在 https://szy-young.github.io/mv-s2v 访问。

关键词

引用

@article{arxiv.2601.17756,
  title  = {MV-S2V: Multi-View Subject-Consistent Video Generation},
  author = {Ziyang Song and Xinyu Gong and Bangya Liu and Zelin Zhao},
  journal= {arXiv preprint arXiv:2601.17756},
  year   = {2026}
}

备注

14 pages, 10 figures