中文

MusiLingo:用预训练语言模型桥接音乐与文本以实现音乐描述与查询响应

音频与语音处理 2024-04-03 v3 人工智能 计算与语言 多媒体 声音

摘要

大语言模型(LLMs)在多模态应用中已展现出巨大潜力,然而文本与音乐领域的融合仍未被充分探索。为弥补这一空白,我们提出 MusiLingo,一种用于音乐描述生成与音乐相关查询响应的新颖系统。MusiLingo 采用单层投影将来自预训练冻结音乐音频模型 MERT 的音乐表示与冻结的 LLM 对齐,从而弥合音乐音频与文本语境间的鸿沟。我们在大规模音乐描述数据集上训练它,并用指令数据微调。由于高质量音乐问答数据集的匮乏,我们从 MusicCaps 数据集中的描述创建了 MusicInstruct(MI)数据集,专为开放式音乐询问定制。实证评估表明其在生成音乐描述与构建音乐相关问答对方面具有竞争力。我们引入的数据集实现了相较先前数据集的显著进展。

关键词

引用

@article{arxiv.2309.08730,
  title  = {MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response},
  author = {Zihao Deng and Yinghao Ma and Yudong Liu and Rongchen Guo and Ge Zhang and Wenhu Chen and Wenhao Huang and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2309.08730},
  year   = {2024}
}