中文

灯光、摄像机、一致性:面向字符稳定 AI 视频故事的多阶段管线

计算机视觉与模式识别 2025-12-22 v1 人工智能

摘要

生成具有一致性的长篇视频故事是当前文本到视频 AI 的重大挑战。我们提出了一种以导演方式处理视频生成的方法。我们的管线首先使用大型语言模型生成详细的制作脚本。该脚本指导文本到图像模型为每个角色创建一致的视觉元素,随后这些视觉锚点用于视频生成模型逐场景合成视频。我们的基线比较验证了这种多阶段分解的必要性;具体观察到,若移除视觉锚点机制,角色一致性分数将从 7.99 急剧下降至 0.55,确认视觉先验对身份保持至关重要。进一步,我们分析了当前模型在不同文化背景下的差异,揭示了在印度主题与西方主题生成中,主体一致性和动态程度存在显著偏差。

关键词

引用

@article{arxiv.2512.16954,
  title  = {Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories},
  author = {Chayan Jain and Rishant Sharma and Archit Garg and Ishan Bhanuka and Pratik Narang and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2512.16954},
  year   = {2025}
}

备注

Under Review