Mora:通过多智能体框架实现通用视频生成
计算机视觉与模式识别
2024-10-07 v3
摘要
文本到视频生成已取得重大进展,但由于 OpenAI Sora 等先进系统的闭源性质,复制其能力仍然具有挑战性。现有的开源方法难以实现可比的性能,往往受到无效智能体协作和训练数据质量不足的阻碍。在本文中,我们引入了 Mora,这是一个利用现有开源模块来复制 Sora 功能的新型多智能体框架。我们通过提出三项关键技术来解决这些基本限制:(1)带有自调制因子的多智能体微调,以增强智能体间的协调;(2)利用大型模型合成训练数据的无数据训练策略;(3)结合多模态大型语言模型的人在回路机制进行数据过滤,以确保高质量的训练数据集。我们在六项视频生成任务上的综合实验表明,Mora 在 VBench 上取得了与 Sora 相当的性能,在各种任务中均优于现有的开源方法。具体而言,在文本到视频生成任务中,Mora 获得了 0.800 的视频质量得分,超过了 Sora 的 0.797,并在六项关键指标上优于所有其他基线模型。此外,在图像到视频生成任务中,Mora 获得了完美的 1.00 动态程度得分,展示了其在增强运动真实感方面的卓越能力,并实现了比 Sora 更高的成像质量。这些结果突显了协作多智能体系统和人在回路机制在推进文本到视频生成方面的潜力。我们的代码可在 \url{https://github.com/lichao-sun/Mora} 获取。
引用
@article{arxiv.2403.13248,
title = {Mora: Enabling Generalist Video Generation via A Multi-Agent Framework},
author = {Zhengqing Yuan and Yixin Liu and Yihan Cao and Weixiang Sun and Haolong Jia and Ruoxi Chen and Zhaoxu Li and Bin Lin and Li Yuan and Lifang He and Chi Wang and Yanfang Ye and Lichao Sun},
journal= {arXiv preprint arXiv:2403.13248},
year = {2024}
}