中文

StoryAgent:通过多智能体协作实现定制化叙事视频生成

计算机视觉与模式识别 2024-11-12 v2 人工智能 多智能体系统

摘要

AI生成内容(AIGC)的兴起推动了自动化视频生成研究,以简化传统流程。然而,自动化叙事视频制作,特别是定制化叙事,仍然具有挑战性,这是由于在镜头之间保持主体一致性方面的复杂性所致。虽然现有方法如Mora和AesopAgent集成了多个智能体用于故事到视频(S2V)生成,但它们在保持主角一致性和支持定制化叙事视频生成(CSVG)方面存在不足。为解决这些局限性,我们提出了StoryAgent,一个用于CSVG的多智能体框架。StoryAgent将CSVG分解为分配给专门智能体的不同子任务,模仿专业制作流程。值得注意的是,我们的框架包括用于故事设计、分镜生成、视频创建、智能体协调和结果评估的智能体。利用不同模型的优势,StoryAgent增强了对生成过程的控制,显著提高了角色一致性。具体而言,我们引入了一种定制的图像到视频(I2V)方法LoRA-BE以增强镜头内时间一致性,同时提出了一种新颖的分镜生成流程以保持镜头间的主体一致性。广泛的实验证明了我们方法在合成高度一致的叙事视频方面的有效性,优于最先进方法。我们的贡献包括引入StoryAgent——一个用于视频生成任务的通用框架,以及用于保持主角一致性的新技术。

关键词

引用

@article{arxiv.2411.04925,
  title  = {StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration},
  author = {Panwen Hu and Jin Jiang and Jianqi Chen and Mingfei Han and Shengcai Liao and Xiaojun Chang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2411.04925},
  year   = {2024}
}