基于多智能体思维链规划的电影自动生成
计算机视觉与模式识别
2025-03-11 v1
摘要
现有的长视频生成框架缺乏自动规划,需要手动输入故事情节、场景、摄影和角色互动,导致成本高昂且效率低下。为了应对这些挑战,我们提出了 MovieAgent,一种通过多智能体思维链规划进行电影自动生成的方法。MovieAgent 具有两个关键优势:1) 我们首次探索并定义了电影/长视频自动生成的范式。给定剧本和角色库,我们的 MovieAgent 能够生成具有连贯叙事的多场景、多镜头长视频,同时确保整部电影的角色一致性、字幕同步和音频稳定。2) MovieAgent 引入了基于分层 CoT 的推理过程,以自动构建场景、摄像机设置和摄影,显著减少了人工投入。通过采用多个 LLM 智能体来模拟导演、编剧、分镜师和选景导演的角色,MovieAgent 简化了制作流程。实验表明,MovieAgent 在剧本忠实度、角色一致性和叙事连贯性方面取得了新的 SOTA 结果。我们的分层框架向前迈出了一步,为全自动电影生成提供了新的见解。代码和项目网站可在以下网址获取:https://github.com/showlab/MovieAgent 和 https://weijiawu.github.io/MovieAgent。
引用
@article{arxiv.2503.07314,
title = {Automated Movie Generation via Multi-Agent CoT Planning},
author = {Weijia Wu and Zeyu Zhu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2503.07314},
year = {2025}
}
备注
The code and project website are available at: https://github.com/showlab/MovieAgent and https://weijiawu.github.io/MovieAgent