剧本即一切:面向长程对话到电影级视频生成的智能体框架
计算机视觉与模式识别
2026-05-28 v3 人工智能
摘要
视频生成的最新进展产生了能够根据简单文本提示合成令人惊叹的视觉内容的模型。然而,这些模型难以从对话等高级概念生成连贯的长篇叙事,揭示了创意想法与其电影执行之间的“语义鸿沟”。为弥合这一鸿沟,我们引入了一个新颖的、端到端的对话到电影级视频生成的智能体框架。我们框架的核心是ScripterAgent,一个经过训练可将粗略对话转化为精细、可执行的电影剧本的模型。为实现这一点,我们构建了ScriptBench,一个具有丰富多模态上下文的新大规模基准,通过专家引导的流程进行标注。生成的剧本随后指导DirectorAgent,它使用跨场景连续生成策略编排最先进的视频模型,以确保长程连贯性。我们的综合评估,包括一个由AI驱动的CriticAgent和一个新的视觉-剧本对齐(VSA)指标,表明我们的框架在所有测试的视频模型上显著提高了剧本忠实度和时间保真度。此外,我们的分析揭示了当前最先进模型中视觉奇观与严格遵循剧本之间的关键权衡,为自动电影制作的未来提供了宝贵的见解。
引用
@article{arxiv.2601.17737,
title = {The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation},
author = {Chenyu Mu and Xin He and Qu Yang and Wanshun Chen and Jiadi Yao and Huang Liu and Zihao Yi and Bo Zhao and Xingyu Chen and Ruotian Ma and Fanghua Ye and Erkun Yang and Cheng Deng and Zhaopeng Tu and Xiaolong Li and Linus},
journal= {arXiv preprint arXiv:2601.17737},
year = {2026}
}