MuSS:面向多镜头主体到视频生成的大规模数据集与电影叙事基准
计算机视觉与模式识别
2026-05-12 v2
摘要
虽然视频基础模型在单镜头生成方面表现出色,但现实世界的电影叙事本质上依赖于复杂的多镜头序列。进一步的进展受限于缺乏解决三个核心挑战的数据集:叙事逻辑真实性、时空文本视频对齐冲突以及 Subject-to-Video(S2V)生成中常见的“复制粘贴”困境。为填补这一差距,我们引入 MuSS,一个大规模、双轨数据集,专为多镜头视频和 S2V 生成而设计。该数据集源自超过 3000 部电影,显式支持复杂的蒙太奇过渡和以主体为中心的叙事。为构建该数据集,我们 pioneering 了一套渐进式标注流程,通过确保局部镜台级准确性后再强制全局叙事连贯性,以消除情境冲突。关键在于我们实施了跨镜头匹配机制,从根本上根除 S2V 的复制粘贴捷径。除了数据集之外,我们提出了电影叙事基准,特点是基于视觉逻辑的范式和一种新颖的 Anti-Copy-Paste Variance(ACP-Var)指标,用于严格评估连续叙事和 3D 结构一致性。大量实验表明,当前的基线在连续叙事逻辑方面困难,甚至会退化为平凡的 2D 贴纸生成器,而我们的 MuSS 增强模型在叙事效果和跨镜头身份保持方面实现了最先进的水平。
引用
@article{arxiv.2604.23789,
title = {MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation},
author = {Haojie Zhang and Di Wu and Bingyan Liu and Linjie Zhong and Yuancheng Wei and Xingsong Ye and Nanqing Liu and Yaling Liang},
journal= {arXiv preprint arXiv:2604.23789},
year = {2026}
}
备注
17 pages, 9 figues