中文

JamendoMaxCaps:大规模音乐-描述数据集与插补元数据

声音 2025-05-19 v2 人工智能

摘要

我们提出 JamendoMaxCaps,一个大规模音乐-描述数据集,包含来自知名 Jamendo 平台的超过 362,000 首自由许可的器乐曲目。该数据集包含由最先进的描述模型生成的描述,并辅以插补元数据。我们还引入了一种检索系统,该系统利用音乐特征和元数据来识别相似歌曲,然后使用本地大语言模型(LLLM)填充缺失的元数据。这种方法使我们能够为从事音乐-语言理解任务的研究人员提供更全面、更有信息量的数据集。我们通过五种不同的测量方法对该方法进行了定量验证。通过公开发布 JamendoMaxCaps 数据集,我们为推进音乐检索、多模态表示学习和生成式音乐模型等音乐-语言理解任务的研究提供了高质量资源。

关键词

引用

@article{arxiv.2502.07461,
  title  = {JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata},
  author = {Abhinaba Roy and Renhang Liu and Tongyu Lu and Dorien Herremans},
  journal= {arXiv preprint arXiv:2502.07461},
  year   = {2025}
}

备注

8 pages, 5 figures