音乐记谱理解基准测试:评估大语言模型对完整音乐记谱的理解能力
声音
2026-04-24 v4 人工智能
摘要
理解完整音乐记谱需要对音高、节奏、和声及宏观结构进行综合推理,而目前大语言模型和视觉语言模型在解读完整音乐记谱的能力尚未得到充分评估。我们引入音乐记谱理解基准测试(MSU-Bench),这是一套人类精选的用于记谱级音乐理解的基准测试,涵盖文本(ABC记谱)与视觉(PDF)两种模态。MSU-Bench包含1800组来自巴赫、贝多芬、 Chopin、德布西等作品的生成式问答对,按难度递增划分为四个等级,从 onset 信息到纹理与结构。评估超过十五种最先进模型(零样本与微调 setting),结果显示出显著的模态差异、等级性能的不稳定性以及在保持多层次正确性方面的挑战。微调显著提升了跨模态下的表现,同时保留了通用知识,使MSU-Bench成为未来研究多模态推理的稳健基础。该基准测试及代码已发布于 https://github.com/Congren-Dai/MSU-Bench。
引用
@article{arxiv.2511.20697,
title = {Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores},
author = {Congren Dai and Yue Yang and Krinos Li and Huichi Zhou and Shijie Liang and Bo Zhang and Enyang Liu and Ge Jin and Hongran An and Haosen Zhang and Peiyuan Jing and Kinhei Lee and Z henxuan Zhang and Xiaobing Li and Maosong Sun},
journal= {arXiv preprint arXiv:2511.20697},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference