中文

LP-MusicCaps:基于大语言模型的伪音乐描述生成

声音 2023-08-01 v1 信息检索 多媒体 音频与语音处理

摘要

自动音乐描述生成可为给定音乐曲目生成自然语言描述,在提升对大量音乐数据的理解与管理方面具有重要潜力。尽管其重要,研究者仍面临挑战,因为现有音乐-语言数据集的收集过程昂贵且耗时,规模有限。为解决该数据稀缺问题,我们提出利用大语言模型(LLMs)从大规模标签数据集人工生成描述句子。这产生了约220万条描述与50万段音频片段的配对。我们称之为基于大语言模型的伪音乐描述数据集,简称LP-MusicCaps。我们利用自然语言处理领域的多种定量评价指标以及人工评估,对该大规模音乐描述数据集进行了系统性评价。此外,我们用该数据集训练了一个基于transformer的音乐描述模型,并在零样本与迁移学习设定下进行了评估。结果表明我们提出的方法优于有监督基线模型。

关键词

引用

@article{arxiv.2307.16372,
  title  = {LP-MusicCaps: LLM-Based Pseudo Music Captioning},
  author = {SeungHeon Doh and Keunwoo Choi and Jongpil Lee and Juhan Nam},
  journal= {arXiv preprint arXiv:2307.16372},
  year   = {2023}
}

备注

Accepted for publication at the 24th International Society for Music Information Retrieval Conference (ISMIR 2023)