中文

CMI-Bench:评估音乐指令跟随能力的综合基准测试

音频与语音处理 2025-07-01 v2 人工智能 机器学习 声音

摘要

音频-文本大语言模型(LLM)的最新进展为音乐理解与生成开辟了新的可能性。然而,现有基准测试范围有限,通常依赖简化任务或多选评估,无法反映真实音乐分析的复杂性。我们将一系列传统的音乐信息检索(MIR)标注重新解释为指令跟随格式,并提出了 CMI-Bench——一个全面的音乐指令跟随基准测试,旨在评估音频-文本 LLM 在多样化音乐信息检索任务上的表现。这些任务包括:流派分类、情感回归、情感标注、乐器分类、音高估计、调性检测、歌词转录、旋律提取、声乐技巧识别、乐器演奏技巧检测、音乐标注、音乐描述生成以及(下)节拍追踪:反映了 MIR 研究的核心挑战。与之前的基准测试不同,CMI-Bench 采用与先前最先进 MIR 模型一致的标准化评估指标,确保与监督方法具有直接可比性。我们提供了一个支持所有开源音频-文本 LLM 的评估工具包,包括 LTU、Qwen-audio、SALMONN、MusiLingo 等。实验结果揭示了 LLM 与监督模型之间的显著性能差距,以及它们在文化、年代和性别方面的偏差,凸显了当前模型在应对 MIR 任务方面的潜力与局限性。CMI-Bench 为评估音乐指令跟随建立了统一基础,推动音乐感知 LLM 的发展。

关键词

引用

@article{arxiv.2506.12285,
  title  = {CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following},
  author = {Yinghao Ma and Siyou Li and Juntao Yu and Emmanouil Benetos and Akira Maezawa},
  journal= {arXiv preprint arXiv:2506.12285},
  year   = {2025}
}

备注

Accepted by ISMIR 2025