中文

MQAD:面向训练音乐大语言模型的大规模问答数据集

声音 2025-08-28 v1

摘要

问答(QA)是人类理解音乐音频的自然方式。然而,对于机器来说,获取覆盖音乐多样方面的大规模数据集至关重要且具有挑战性,这由于公共可获取的此类音乐数据的稀缺。本文介绍了 MQAD,一个构建于 Million Song Dataset(MSD)上的音乐 QA 数据集,涵盖了丰富的音乐特征,包括节拍、和弦、调性、结构、乐器和流派——覆盖 27 万首歌曲,包含近 300 万个多样化问题和标题。MQAD 独特之处在于提供了详细的时间变化音乐信息,如和弦和段落, enables 在歌曲内探索音乐的内在结构。为编译 MQAD,我们的方法利用专业的音乐信息检索(MIR)模型提取更高层次的音乐特征,并利用大型语言模型(LLM)生成自然语言 QA 对。然后,我们利用一种多模态 LLM,将 LLaMA2 和 Whisper 架构集成在一起, along with novel subjective metrics 来评估 MQAD 的性能。在实验中,我们的模型在 MQAD 上训练后显示出超过传统音乐音频标题生成方法的进步。数据集和代码均可在 https://github.com/oyzh888/MQAD 上获取。

关键词

引用

@article{arxiv.2508.19514,
  title  = {MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models},
  author = {Zhihao Ouyang and Ju-Chiang Wang and Daiyu Zhang and Bin Chen and Shangjie Li and Quan Lin},
  journal= {arXiv preprint arXiv:2508.19514},
  year   = {2025}
}