中文

面向电影长视频生成的无训练方法CineLOG

计算机视觉与模式识别 2025-12-16 v1

摘要

可控视频合成是计算机视觉中的核心挑战,但现有模型在文本提示之外的细粒度控制方面困难,尤其是针对电影属性如摄像机轨迹和类型。现有数据集常 suffer于严重的数据不平衡、标签噪声或显著的模拟到真实差距。为此,我们引入CineLOG,一个包含5,000个高质量、平衡且未剪切视频片段的数据集。每个条目都附带详细场景描述、基于标准电影分类学的明确摄像机指令以及类型标签,确保覆盖17种多样化摄像机运动和15种电影类型。我们还提出了创建此数据集的新型管道,将复杂的文本到视频(T2V)生成任务分解为四个更容易的阶段。为实现连贯的多镜头序列,我们引入了创新的轨迹引导过渡模块,用于生成平滑的时空插值。广泛的人类评估表明,我们的管道在遵循特定摄像机和剧本指令方面显著优于SOTA端到端T2V模型,同时保持专业的视觉质量。所有代码和数据均在 https://cine-log.pages.dev 提供。

关键词

引用

@article{arxiv.2512.12209,
  title  = {CineLOG: A Training Free Approach for Cinematic Long Video Generation},
  author = {Zahra Dehghanian and Morteza Abolghasemi and Hamid Beigy and Hamid R. Rabiee},
  journal= {arXiv preprint arXiv:2512.12209},
  year   = {2025}
}