InfinityStory:具备世界一致性和角色感知的无限视频生成
计算机视觉与模式识别
2026-03-05 v1
摘要
生成具备一致视觉叙事的长篇故事视频仍是视频合成中的重大挑战。我们提出一种新框架、数据集和模型,解决三个关键局限性:跨镜头背景的一致性、跨镜头的无缝多主体转换、以及对小时级叙事的可扩展性。我们的ethods 方法引入背景一致的生成管道,维持场景之间视觉连贯性,同时保留角色身份和空间关系。我们进一步提出一种感知转换的视频合成模块,生成涉及多个主体进入或退出画面的平滑镜头转换,超越现有工作针对单主体的局限性。为支持此目标,我们贡献了一个包含 10,000 个多主体转换序列的合成数据集,涵盖 underrepresented 动态场景构图。在 VBench 上,InfinityStory 实现了最高的背景一致性 (88.94),最高的主体一致性 (82.11),以及最佳的整体平均排名 (2.80),显示出 improved 的稳定性、更平滑的转换以及更好的时序连贯性。
引用
@article{arxiv.2603.03646,
title = {InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions},
author = {Mohamed Elmoghany and Liangbing Zhao and Xiaoqian Shen and Subhojyoti Mukherjee and Yang Zhou and Gang Wu and Viet Dac Lai and Seunghyun Yoon and Ryan Rossi and Abdullah Rashwan and Puneet Mathur and Varun Manjunatha and Daksh Dangi and Chien Nguyen and Nedim Lipka and Trung Bui and Krishna Kumar Singh and Ruiyi Zhang and Xiaolei Huang and Jaemin Cho and Yu Wang and Namyong Park and Zhengzhong Tu and Hongjie Chen and Hoda Eldardiry and Nesreen Ahmed and Thien Nguyen and Dinesh Manocha and Mohamed Elhoseiny and Franck Dernoncourt},
journal= {arXiv preprint arXiv:2603.03646},
year = {2026}
}