HumMusQA:面向人类书写音乐理解的 QA 基准数据集
计算与语言
2026-03-31 v1 声音
摘要
评估大型音频语言模型(LALMs)中的音乐理解能力,需要一个严格定义的基准,才能真正检验模型是否能够感知和解释音乐,而当前的数据方法常常未能满足这一标准。本文提出一种精细化的评估方法,构建包含 320 个由拥有音乐训练的专家精选并验证的问题人工书写数据集,认为此类聚焦且手动筛选的方法对于探索复杂音频理解更为有效。为展示该数据集的用途,我们对六个最先进的 LALMs 进行基准测试,并额外测试其对单模态捷径的鲁棒性。
引用
@article{arxiv.2603.27877,
title = {HumMusQA: A Human-written Music Understanding QA Benchmark Dataset},
author = {Benno Weck and Pablo Puentes and Andrea Poltronieri and Satyajeet Prabhu and Dmitry Bogdanov},
journal= {arXiv preprint arXiv:2603.27877},
year = {2026}
}
备注
Dataset available at https://doi.org/10.5281/zenodo.18462523