中文

MMAU-Pro:用于全面评估音频通用智能的挑战性且完善的基准

音频与语音处理 2025-08-20 v1 声音

摘要

音频理解——包括语音、非语音声音和音乐——是实现人类水平智能的关键。因此,AI 代理必须在方面展现全面的音频理解能力,才能被视为具备通用智能。然而,全面评估听觉智能 remains 挑战。为填补这一差距,我们引入 MMAU-Pro,这是评估 AI 系统音频智能最全面、最严格筛选的基准。MMAU-Pro 包含 5,305 个实例,每个实例包含一个或多个音频,配有人类专家生成的问答对,涵盖语音、声音、音乐及其组合。与现有基准不同,MMAU-Pro 评估了音频智能的 49 项独特技能及多个复杂维度,包括长篇音频理解、空间音频推理、多音频理解等。所有问题都经过精心设计,需要明确的多跳推理,包括多选和开放式回答格式。重要的是,音频数据直接来源于“野外”,而非来自已知分布的现有数据集。我们评估了 22 所领先的开源和商业多模态 AI 模型,揭示了显著的局限性:即使是像 Gemini 2.5 Flash 和 Audio Flamingo 3 这类最先进的模型,在多个类别中的准确率也仅为 59.2% 和 51.7%,接近随机水平。我们的广泛分析揭示了具体的不足之处,提供了新的见解,为社区提升未来 AI 系统向音频通用智能发展提供了可操作的视角。该基准和代码已提供于 https://sonalkum.github.io/mmau-pro。

关键词

引用

@article{arxiv.2508.13992,
  title  = {MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence},
  author = {Sonal Kumar and Šimon Sedláček and Vaibhavi Lokegaonkar and Fernando López and Wenyi Yu and Nishit Anand and Hyeonggon Ryu and Lichang Chen and Maxim Plička and Miroslav Hlaváček and William Fineas Ellingwood and Sathvik Udupa and Siyuan Hou and Allison Ferner and Sara Barahona and Cecilia Bolaños and Satish Rahi and Laura Herrera-Alarcón and Satvik Dixit and Siddhi Patil and Soham Deshmukh and Lasha Koroshinadze and Yao Liu and Leibny Paola Garcia Perera and Eleni Zanou and Themos Stafylakis and Joon Son Chung and David Harwath and Chao Zhang and Dinesh Manocha and Alicia Lozano-Diez and Santosh Kesiraju and Sreyan Ghosh and Ramani Duraiswami},
  journal= {arXiv preprint arXiv:2508.13992},
  year   = {2025}
}