CineTrans:通过掩码扩散模型生成带电影转场的视频
计算机视觉与模式识别
2026-03-03 v2
摘要
尽管视频合成取得了显著进展,但多镜头视频生成研究仍处于初级阶段。即使使用规模更大的模型和大数据集,镜头转换能力仍显粗糙且不稳定,主要将生成视频限制在单镜头序列。本文引入 CineTrans,一种用于生成带有电影风格转场的连贯多镜头视频的新框架。为获取电影剪辑风格的洞见,我们构建了一个带详细镜头标注的多镜头视频文本数据集 Cine250K。此外,我们对现有视频扩散模型的分析揭示了扩散模型注意力图与镜头边界之间的对应关系,这一发现被用于设计一种掩码控制机制,使可在任意位置实现转场,并在训练无监督设置下有效迁移。在该数据集上进行微调后,CineTrans 能够生成遵循电影剪辑风格的多镜头序列,避免不稳定的转场或简单拼接。最后,我们提出了用于转场控制、时间一致性和整体质量的专用评估指标,并通过大量实验表明 CineTrans 在所有标准上均显著优于现有基线方法。
引用
@article{arxiv.2508.11484,
title = {CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models},
author = {Xiaoxue Wu and Bingjie Gao and Yu Qiao and Yaohui Wang and Xinyuan Chen},
journal= {arXiv preprint arXiv:2508.11484},
year = {2026}
}
备注
ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/