中文

MuChoMusic: 评估多模态音频-语言模型中的音乐理解能力

声音 2024-08-05 v1 计算与语言 机器学习 多媒体 音频与语音处理

摘要

联合处理音频和语言的多模态模型在音频理解方面具有巨大潜力,并越来越多地被应用于音乐领域。通过允许用户通过文本查询并获取有关给定音频输入的信息,这些模型有望通过基于语言的接口实现多种音乐理解任务。然而,它们的评估面临相当大的挑战,目前的方法如何有效评估其正确解释音乐相关输入的能力仍不清楚。出于这一动机,我们引入了 MuChoMusic,一个用于评估面向音频的多模态语言模型中音乐理解的基准。MuChoMusic 包含 1,187 道选择题,全部经过人工标注者验证,涵盖来自两个公开可用音乐数据集的 644 首音乐曲目,覆盖广泛的音乐类型。基准中的问题旨在评估多个维度上的知识和推理能力,涵盖基本音乐概念及其与文化与功能语境的关系。通过基准提供的整体分析,我们评估了五个开源模型,并识别出若干缺陷,包括对语言模态的过度依赖,指出了更好的多模态融合的必要性。数据和代码已开源。

关键词

引用

@article{arxiv.2408.01337,
  title  = {MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models},
  author = {Benno Weck and Ilaria Manco and Emmanouil Benetos and Elio Quinton and George Fazekas and Dmitry Bogdanov},
  journal= {arXiv preprint arXiv:2408.01337},
  year   = {2024}
}

备注

Accepted at ISMIR 2024. Data: https://doi.org/10.5281/zenodo.12709974 Code: https://github.com/mulab-mir/muchomusic Supplementary material: https://mulab-mir.github.io/muchomusic