Cut2Next:通过上下文微调生成下一个镜头
计算机视觉与模式识别
2025-08-13 v2 人工智能
摘要
有效的多镜头生成需要有目的性的、电影化的转场和严格的电影连续性。然而,当前的方法往往优先考虑基本的视觉一致性,忽略了推动叙事流以进行引人入胜的故事讲述的关键剪辑模式(例如,正反打镜头、切出镜头)。这导致输出可能在视觉上连贯,但缺乏叙事复杂性和真正的电影完整性。为了弥补这一差距,我们引入了下一个镜头生成(NSG):合成一个后续的高质量镜头,该镜头严格遵循专业的剪辑模式,同时保持严格的电影连续性。我们的框架 Cut2Next 利用了一个扩散 Transformer(DiT)。它采用由一种新颖的分层多提示策略引导的上下文微调。该策略使用关系提示来定义整体上下文和镜头间剪辑风格。然后,个体提示指定每个镜头的内容和电影摄影属性。这些共同引导 Cut2Next 生成电影化上合适的下一个镜头。架构创新,上下文感知条件注入(CACI)和分层注意力掩码(HAM),进一步整合了这些多样化的信号,而无需引入新参数。我们构建了 RawCuts(大规模)和 CuratedCuts(精炼)数据集,两者都带有分层提示,并引入了 CutBench 用于评估。实验表明,Cut2Next 在视觉一致性和文本保真度方面表现出色。至关重要的是,用户研究显示了对 Cut2Next 的强烈偏好,特别是对其遵循预期剪辑模式和整体电影连续性的能力,验证了其生成高质量、叙事表达力强且电影化连贯的后续镜头的能力。
引用
@article{arxiv.2508.08244,
title = {Cut2Next: Generating Next Shot via In-Context Tuning},
author = {Jingwen He and Hongbo Liu and Jiajun Li and Ziqi Huang and Yu Qiao and Wanli Ouyang and Ziwei Liu},
journal= {arXiv preprint arXiv:2508.08244},
year = {2025}
}