中文

基于公共编辑元数据的 Discogs-VI 歌曲版本识别数据集

声音 2024-10-24 v1 音频与语音处理

摘要

当前版本识别(Version Identification, VI)数据集往往规模不足且缺乏足够的音乐多样性,以致难以训练鲁棒的神经网络(NN)。此外,这些数据集的非代表性 clique 大小分布也妨碍了真实系统的评估。为此,我们探索了 Discogs 音乐数据库中丰富编辑元数据的潜在价值,构建了包含约 190 万个版本、跨 34.8 万个 clique 的大型音乐版本数据集。通过高精度搜索算法,我们将该数据集映射到 YouTube 官方音频上传,得到约 49.3 万个版本、跨 9.8 万个 clique 的数据集。该数据集的 clique 数量是现有数据集的 9 倍以上,版本数量是其 4 倍以上。我们通过在不复杂模型结构或数据增强的情况下训练基线 NN,展示了数据集的实用性,该模型在 SHS100K 和 Da-TACOS 数据集上取得具竞争力的成绩。我们的数据集以及用于构建数据的工具、提取的音频特征和训练好的模型均公开提供。

关键词

引用

@article{arxiv.2410.17400,
  title  = {Discogs-VI: A Musical Version Identification Dataset Based on Public Editorial Metadata},
  author = {R. Oguz Araz and Xavier Serra and Dmitry Bogdanov},
  journal= {arXiv preprint arXiv:2410.17400},
  year   = {2024}
}