中文

FilmAgent:面向虚拟3D空间端到端电影自动化的多智能体框架

计算与语言 2025-01-23 v1 图形学 多智能体系统

摘要

虚拟电影制作需要复杂的决策过程,包括剧本创作、虚拟摄影以及精确的演员定位与动作。受近期基于语言智能体社会的自动化决策进展启发,本文提出了 FilmAgent,一种基于 LLM 的多智能体协作框架,用于在我们构建的 3D 虚拟空间中实现端到端的电影自动化。FilmAgent 模拟了导演、编剧、演员和摄影师等各种剧组角色,并涵盖了电影制作工作流程的关键阶段:(1)创意开发将头脑风暴的创意转化为结构化的故事大纲;(2)剧本创作细化每个场景的对话和角色动作;(3)摄影确定每个镜头的摄像机设置。智能体团队通过迭代反馈和修订进行协作,从而验证中间剧本并减少幻觉。我们在 15 个创意和 4 个关键方面对生成的视频进行了评估。人类评估表明,FilmAgent 在所有方面均优于所有基线,平均得分为 3.98(满分 5 分),展示了多智能体协作在电影制作中的可行性。进一步分析表明,尽管使用了较不先进的 GPT-4o 模型,FilmAgent 仍超越了单智能体 o1,展现了协调良好的多智能体系统的优势。最后,我们讨论了 OpenAI 的文本到视频模型 Sora 与我们的 FilmAgent 在电影制作中的互补优势与不足。

关键词

引用

@article{arxiv.2501.12909,
  title  = {FilmAgent: A Multi-Agent Framework for End-to-End Film Automation in Virtual 3D Spaces},
  author = {Zhenran Xu and Longyue Wang and Jifang Wang and Zhouyi Li and Senbao Shi and Xue Yang and Yiyu Wang and Baotian Hu and Jun Yu and Min Zhang},
  journal= {arXiv preprint arXiv:2501.12909},
  year   = {2025}
}

备注

Work in progress. Project Page: https://filmagent.github.io/