中文

WildScore:在真实场景中评测多模态大语言模型的符号音乐推理

声音 2026-01-26 v2 计算与语言 音频与语音处理

摘要

多模态大语言模型(MLLMs)的最新进展展示了其在各种视觉-语言任务上的令人印象深刻的能力。然而,它们在多模态符号音乐领域的推理能力在很大程度上仍未被探索。我们引入了 WildScore,这是第一个真实场景下的多模态符号音乐推理与分析基准,旨在评估 MLLMs 解释真实世界乐谱和回答复杂音乐学问题的能力。WildScore 中的每个实例均来源于真实的音乐作品,并伴有真实的用户生成问题和讨论,捕捉了实际音乐分析的复杂性。为了促进系统评估,我们提出了一个系统的分类法,包含高级和细粒度的音乐学本体。此外,我们将复杂的音乐推理构建为多项选择题问答,从而实现对 MLLMs 符号音乐理解的受控和可扩展评估。在 WildScore 上对最先进的 MLLMs 进行的实证基准测试揭示了其视觉-符号推理中的有趣模式,揭示了 MLLMs 在符号音乐推理和分析方面的有前景方向和持续挑战。我们发布了数据集和代码。

关键词

引用

@article{arxiv.2509.04744,
  title  = {WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning},
  author = {Gagan Mundada and Yash Vishe and Amit Namburi and Xin Xu and Zachary Novack and Julian McAuley and Junda Wu},
  journal= {arXiv preprint arXiv:2509.04744},
  year   = {2026}
}