灯光、摄像机、一致性:面向字符稳定 AI 视频故事的多阶段管线
计算机视觉与模式识别
2025-12-22 v1 人工智能
摘要
生成具有一致性的长篇视频故事是当前文本到视频 AI 的重大挑战。我们提出了一种以导演方式处理视频生成的方法。我们的管线首先使用大型语言模型生成详细的制作脚本。该脚本指导文本到图像模型为每个角色创建一致的视觉元素,随后这些视觉锚点用于视频生成模型逐场景合成视频。我们的基线比较验证了这种多阶段分解的必要性;具体观察到,若移除视觉锚点机制,角色一致性分数将从 7.99 急剧下降至 0.55,确认视觉先验对身份保持至关重要。进一步,我们分析了当前模型在不同文化背景下的差异,揭示了在印度主题与西方主题生成中,主体一致性和动态程度存在显著偏差。
引用
@article{arxiv.2512.16954,
title = {Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories},
author = {Chayan Jain and Rishant Sharma and Archit Garg and Ishan Bhanuka and Pratik Narang and Dhruv Kumar},
journal= {arXiv preprint arXiv:2512.16954},
year = {2025}
}
备注
Under Review