中文

MMAR:语音、音频、音乐及其混合信号深度推理的挑战性基准

声音 2025-05-20 v1 计算与语言 多媒体 音频与语音处理

摘要

我们引入 MMAR,一个旨在评估音频语言模型 (ALMs) 跨多学科任务深度推理能力的新基准。MMAR 包含 1000 组精心策划的音频-问题-答案三元组,来自真实网络视频,通过反复错误纠正和质量检查确保高质量。不同于现有仅限于声音、音乐或语音特定领域的基准,MMAR 拓展到广泛的真实世界音频场景,包括声音、音乐和语音的混合模态组合。MMAR 中的每个问题在四个推理层级中进行层次化分类:信号层、感知层、语义层和文化层,每一层级内还细分为子类别,以反映任务的多样性和复杂性。为进一步推动此领域的研究,我们为每个问题标注了链式思维 (CoT) 论述,以促进未来在音频推理方面的发展。MMAR 的每个项目都要求超越表面理解的多步骤深度推理。此外,部分问题需要 graduate 水平的感知和领域特定知识,提升了基准的难度和深度。我们使用广泛的模型进行评估,包括大型音频语言模型 (LALMs)、大型音频推理模型 (LARMs)、通用语言模型 (OLMs)、大型语言模型 (LLMs) 和大型推理模型 (LRMs),输入为音频描述。这些模型在 MMAR 上的表现凸显了基准的具挑战性,我们的分析进一步揭示了当前模型在理解和推理能力方面的关键局限。我们希望 MMAR 将为该重要但鲜有探索的领域的未来进步提供催化剂。

关键词

引用

@article{arxiv.2505.13032,
  title  = {MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix},
  author = {Ziyang Ma and Yinghao Ma and Yanqiao Zhu and Chen Yang and Yi-Wen Chao and Ruiyang Xu and Wenxi Chen and Yuanzhe Chen and Zhuo Chen and Jian Cong and Kai Li and Keliang Li and Siyou Li and Xinfeng Li and Xiquan Li and Zheng Lian and Yuzhe Liang and Minghao Liu and Zhikang Niu and Tianrui Wang and Yuping Wang and Yuxuan Wang and Yihao Wu and Guanrou Yang and Jianwei Yu and Ruibin Yuan and Zhisheng Zheng and Ziya Zhou and Haina Zhu and Wei Xue and Emmanouil Benetos and Kai Yu and Eng-Siong Chng and Xie Chen},
  journal= {arXiv preprint arXiv:2505.13032},
  year   = {2025}
}

备注

Open-source at https://github.com/ddlBoJack/MMAR