中文

Music Understanding LLaMA:以问答与描述为推进的文本到音乐生成

声音 2023-08-23 v1 人工智能 计算与语言 多媒体 音频与语音处理

摘要

文本到音乐生成(T2M-Gen)面临的主要障碍在于缺乏带有自然语言描述的大规模公开音乐数据集。为此,我们提出了 Music Understanding LLaMA(MU-LLaMA),能够回答音乐相关问题并为音乐文件生成描述。我们的模型利用预训练 MERT 模型的音频表示来提取音乐特征。然而,获取用于训练 MU-LLaMA 模型的合适数据集仍然具有挑战性,因为现有的公开音频问答数据集缺乏开放式音乐问答所需的深度。为填补这一空白,我们提出了一种从现有音频描述数据集生成问答对的方法,并引入了专为开放式音乐相关问答设计的 MusicQA 数据集。实验表明,在我们设计的 MusicQA 数据集上训练的所提 MU-LLaMA 模型,在音乐问答和音乐描述生成的各项指标上均取得了优异性能,在这两个领域均优于当前最先进(SOTA)模型,并为 T2M-Gen 研究领域提供了有前景的进展。

关键词

引用

@article{arxiv.2308.11276,
  title  = {Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning},
  author = {Shansong Liu and Atin Sakkeer Hussain and Chenshuo Sun and Ying Shan},
  journal= {arXiv preprint arXiv:2308.11276},
  year   = {2023}
}