中文

MUSE 基准:探索音乐感知与音频 LLM 中的听觉关系推理

人工智能 2025-10-23 v1 声音 音频与语音处理

摘要

多模态大语言模型(MLLMs)在音频理解方面已展现出能力,但当前的评估可能掩盖其关系推理中的根本性弱点。我们提出 Music Understanding and Structural Evaluation(MUSE)基准,这是一个包含 10 个任务的开源资源,用于探索基础音乐感知技能。我们对四个 SOTA 模型(Gemini Pro and Flash、Qwen2.5-Omni、Audio-Flamingo 3)进行评估,并对大型人类基线(N=200)进行比较。我们的结果揭示了 SOTA 模型能力的广泛差异,并持续存在与人类专家之间的差距。尽管 Gemini Pro 在基础感知方面成功,Qwen 和 Audio Flamingo 3 的表现接近随机,暴露了严重的感知缺陷。此外,我们发现链式思维(Chain-of-Thought, 简称 CoT)提示在不一致且常常适得其反。我们的工作提供了一个评估不变音乐表征并推动开发更健壮 AI 系统的关键工具。

关键词

引用

@article{arxiv.2510.19055,
  title  = {The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS},
  author = {Brandon James Carone and Iran R. Roman and Pablo Ripollés},
  journal= {arXiv preprint arXiv:2510.19055},
  year   = {2025}
}

备注

5 pages, 2 figures, 2 tables