中文

HumMusQA:面向人类书写音乐理解的 QA 基准数据集

计算与语言 2026-03-31 v1 声音

摘要

评估大型音频语言模型(LALMs)中的音乐理解能力,需要一个严格定义的基准,才能真正检验模型是否能够感知和解释音乐,而当前的数据方法常常未能满足这一标准。本文提出一种精细化的评估方法,构建包含 320 个由拥有音乐训练的专家精选并验证的问题人工书写数据集,认为此类聚焦且手动筛选的方法对于探索复杂音频理解更为有效。为展示该数据集的用途,我们对六个最先进的 LALMs 进行基准测试,并额外测试其对单模态捷径的鲁棒性。

关键词

引用

@article{arxiv.2603.27877,
  title  = {HumMusQA: A Human-written Music Understanding QA Benchmark Dataset},
  author = {Benno Weck and Pablo Puentes and Andrea Poltronieri and Satyajeet Prabhu and Dmitry Bogdanov},
  journal= {arXiv preprint arXiv:2603.27877},
  year   = {2026}
}

备注

Dataset available at https://doi.org/10.5281/zenodo.18462523