LP-MusicCaps:基于大语言模型的伪音乐描述生成
声音
2023-08-01 v1 信息检索
多媒体
音频与语音处理
摘要
自动音乐描述生成可为给定音乐曲目生成自然语言描述,在提升对大量音乐数据的理解与管理方面具有重要潜力。尽管其重要,研究者仍面临挑战,因为现有音乐-语言数据集的收集过程昂贵且耗时,规模有限。为解决该数据稀缺问题,我们提出利用大语言模型(LLMs)从大规模标签数据集人工生成描述句子。这产生了约220万条描述与50万段音频片段的配对。我们称之为基于大语言模型的伪音乐描述数据集,简称LP-MusicCaps。我们利用自然语言处理领域的多种定量评价指标以及人工评估,对该大规模音乐描述数据集进行了系统性评价。此外,我们用该数据集训练了一个基于transformer的音乐描述模型,并在零样本与迁移学习设定下进行了评估。结果表明我们提出的方法优于有监督基线模型。
引用
@article{arxiv.2307.16372,
title = {LP-MusicCaps: LLM-Based Pseudo Music Captioning},
author = {SeungHeon Doh and Keunwoo Choi and Jongpil Lee and Juhan Nam},
journal= {arXiv preprint arXiv:2307.16372},
year = {2023}
}
备注
Accepted for publication at the 24th International Society for Music Information Retrieval Conference (ISMIR 2023)