中文

评估大型音频语言模型的事实性音乐理解能力

声音 2026-05-28 v2 计算与语言 机器学习

摘要

大型音频语言模型(LALM)利用多模态表示为自然语言查询生成开放式答案。本文(1)提供实证证据表明,使用流行的MusicQA数据集评估LALM的回答是否事实正确,无法衡量模型对音乐的回答是否准确;(2)开发了评估LALM音乐理解能力的新方案。具体而言,我们提出一种评估方案,该方案要求LALM提供可核查的事实信息,并将其开放式响应解析为可客观评估的结构化格式。基于此方案,我们定义了由六个事实信息检索任务构成的基准测试,这些任务分别基于MusicNet、Free Music Archive和OverClocked ReMix三个多样化数据集。我们对九个近期LALM进行基准测试,包括前沿模型如Gemini以及最新的开源模型如Music Flamingo,并在https://github.com/DCL2004/LALM-Eval发布评估脚本套件,以便对新LALM进行基准测试。

关键词

引用

@article{arxiv.2511.05550,
  title  = {Assessing Factual Music Comprehension in Large Audio Language Models},
  author = {Daniel Chenyu Lin and Michael Freeman and John Thickstun},
  journal= {arXiv preprint arXiv:2511.05550},
  year   = {2026}
}

备注

16 pages; second submission