中文

MUST-RAG:基于检索增强生成的音乐文本问答

计算与语言 2025-12-09 v2 人工智能 信息检索 机器学习

摘要

大型语言模型(LLMs)的最新进展展示了其在各个领域的卓越能力。尽管 LLMs 在各种任务中表现出强大的零样本性能,但由于其训练数据中音乐特定知识的占比较小,它们在音乐相关应用中的有效性仍然有限。为了解决这一局限性,我们提出了 MusT-RAG,一个基于检索增强生成(RAG)的综合框架,旨在将通用 LLMs 适配于纯文本的音乐问答(MQA)任务。RAG 是一种通过在生成问题答案时检索相关上下文信息来为 LLMs 提供外部知识的技术。为了针对音乐领域优化 RAG,我们(1)提出了 MusWikiDB,一个用于检索阶段的音乐专用向量数据库;(2)在推理和微调过程中均利用上下文信息,有效地将通用 LLMs 转化为音乐专用模型。我们的实验表明,MusT-RAG 在增强 LLMs 的音乐领域适配能力方面显著优于传统微调方法,在领域内和领域外的 MQA 基准测试中均展现出一致的提升。此外,我们的 MusWikiDB 证明比通用维基百科语料库更为有效,提供了更优的性能和计算效率。

关键词

引用

@article{arxiv.2507.23334,
  title  = {MUST-RAG: MUSical Text Question Answering with Retrieval Augmented Generation},
  author = {Daeyong Kwon and SeungHeon Doh and Juhan Nam},
  journal= {arXiv preprint arXiv:2507.23334},
  year   = {2025}
}

备注

This is an earlier version of the paper - ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering. The latest version is available at: (arXiv:2512.05430)