中文

MM-StoryAgent: 跨文本、图像与音频的多智能体范式沉浸式有声故事书视频生成

计算与语言 2025-03-10 v1

摘要

大型语言模型(LLM)和人工智能生成内容(AIGC)的快速发展加速了AI原生应用的发展,例如为儿童自动生成引人入胜故事的AI故事书。然而,在提升故事吸引力、丰富叙事表现力以及开发开源评估基准和框架方面仍存在挑战。因此,我们提出并开源了MM-StoryAgent,它能够生成具有精细情节、角色一致性图像和多通道音频的沉浸式有声视频故事书。MM-StoryAgent设计了一个多智能体框架,跨多种模态利用LLM和多样化的专家工具(生成模型和API)来制作富有表现力的叙事视频。该框架通过多阶段写作流程增强了故事的吸引力。此外,它通过将音效与视觉、音乐和叙事素材相集成,改善了沉浸式叙事体验。MM-StoryAgent提供了一个灵活的开源平台以供进一步开发,其生成模块可被替换。针对文本故事质量和模态间对齐的客观与主观评估验证了我们提出的MM-StoryAgent系统的有效性。演示和源代码已公开。

关键词

引用

@article{arxiv.2503.05242,
  title  = {MM-StoryAgent: Immersive Narrated Storybook Video Generation with a Multi-Agent Paradigm across Text, Image and Audio},
  author = {Xuenan Xu and Jiahao Mei and Chenliang Li and Yuning Wu and Ming Yan and Shaopeng Lai and Ji Zhang and Mengyue Wu},
  journal= {arXiv preprint arXiv:2503.05242},
  year   = {2025}
}