AudioGenie:面向多样化多模态到多音频生成的免训练多智能体框架
声音
2025-08-06 v2 多智能体系统
多媒体
音频与语音处理
摘要
多模态到多音频(MM2MA)生成在从多模态输入(如视频、文本、图像)合成多样且上下文对齐的音频类型(如音效、语音、音乐和歌曲)方面面临重大挑战,这归因于高质量配对数据集的稀缺以及缺乏鲁棒的多任务学习框架。近期,多智能体系统在解决上述问题上展现出巨大潜力。然而,将其直接应用于 MM2MA 任务存在三个关键挑战:(1) 对多模态输入(尤其是视频)的细粒度理解不足,(2) 单一模型无法处理多样的音频事件,以及 (3) 缺乏用于可靠输出的自我纠正机制。为此,我们提出了 AudioGenie,一种新颖的免训练多智能体系统,具有包含生成团队和监督团队的双层架构。对于生成团队,设计了细粒度任务分解和自适应混合专家协同实体,以实现详细的全面多模态理解和动态模型选择,并设计了试错迭代细化模块以进行自我纠正。监督团队确保时空一致性,并通过反馈循环验证输出。此外,我们构建了 MA-Bench,这是首个针对 MM2MA 任务的基准测试,包含 198 个带有多种类型音频的标注视频。实验表明,我们的 AudioGenie 在 8 项任务的 9 项指标上取得了最先进(SOTA)或可比的性能。用户研究进一步验证了我们的方法在质量、准确性、对齐和美学方面的有效性。包含音频示例的项目网站可在 https://audiogenie.github.io/ 找到。
引用
@article{arxiv.2505.22053,
title = {AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation},
author = {Yan Rong and Jinting Wang and Guangzhi Lei and Shan Yang and Li Liu},
journal= {arXiv preprint arXiv:2505.22053},
year = {2025}
}