MAViS:用于长序列视频叙事的多智能体框架
计算机视觉与模式识别
2026-01-27 v5 人工智能
多智能体系统
摘要
尽管近期进展不断,但长序列视频生成框架仍存在显著局限:辅助能力差、视觉质量次优、表达性有限。为缓解这些局限,本文提出MAViS,一种多智能体协作框架,旨在高效地将想法转化为视觉叙事。MAViS 在多个阶段组织专职智能体,包括剧本编写、镜头设计、角色建模、关键帧生成、视频动画和音频生成。在每个阶段,智能体遵循 "3E 原则"(Explore、Examine、Enhance),确保中间产出的完整性。鉴于当前生成模型的能力限制,我们提出剧本编写准则,以优化剧本与生成工具之间的兼容性。实验结果表明,MAViS 在辅助能力、视觉质量和视频表达性方面实现了最佳性能。其模块化框架进一步支持与多样化生成模型和工具的可扩展性。只需简要描述想法,MAViS 即可快速探索多样化的视觉叙事和创意方向,高效生成高质量、完整的长序列视频。据我们所知,MAViS 是唯一提供多模态设计输出(带叙事和背景音乐的视频)的框架。
引用
@article{arxiv.2508.08487,
title = {MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling},
author = {Qian Wang and Ziqi Huang and Ruoxi Jia and Paul Debevec and Ning Yu},
journal= {arXiv preprint arXiv:2508.08487},
year = {2026}
}
备注
Video Generation Agent