MMAU:大规模多任务音频理解与推理基准
音频与语音处理
2024-10-28 v1 人工智能
计算与语言
声音
摘要
理解音频——包括语音、非语音声音和音乐——对于 AI 代理与世界交互至关重要。我们提出 MMAU,一个新颖的基准测试,旨在评估需要专家水平知识和复杂推理能力的多模态音频理解模型。MMAU 包含 10,000 个精心策划的音频片段,配有人类标注的自然语言问题和答案,涵盖语音、环境声音和音乐。它包括信息提取和推理问题,需要模型在独特且具挑战性的任务中展示 27 项不同技能。与现有基准不同,MMAU 强调了需要领域特定知识的高级感知和推理,挑战模型解决类似专家所面临的任务。我们评估了 18 个开源和专有(大型)音频-语言模型,展示了 MMAU 提出的显著挑战。值得注意的是,即使是最先进的 Gemini Pro v1.5 也仅 achieving 52.97% 的准确率,最先进的开源 Qwen2-Audio 也仅 achieving 52.50%,这凸显了仍有很大的提升空间。我们相信 MMAU 将推动音频和多模态研究社区发展出能够解决复杂音频任务的更高级音频理解模型。
引用
@article{arxiv.2410.19168,
title = {MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark},
author = {S Sakshi and Utkarsh Tyagi and Sonal Kumar and Ashish Seth and Ramaneswaran Selvakumar and Oriol Nieto and Ramani Duraiswami and Sreyan Ghosh and Dinesh Manocha},
journal= {arXiv preprint arXiv:2410.19168},
year = {2024}
}
备注
Project Website: https://sakshi113.github.io/mmau_homepage/