Lakh MIDI 数据集去重研究
声音
2025-09-23 v1 人工智能
机器学习
多媒体
音频与语音处理
摘要
大规模数据集对于训练泛化能力强的深度学习模型至关重要。大多数此类数据集通过从各种互联网来源抓取收集,不可避免地引入了重复数据。在符号音乐领域,这些重复数据通常来自多用户编排和简单编辑后的元数据更改。然而,尽管存在诸如随机划分时数据泄露导致训练评估不可靠等关键问题,数据集重复问题在音乐信息检索(MIR)社区并未得到广泛解决。本研究调查了符号音乐领域最大的公开可用数据源之一——Lakh MIDI 数据集(LMD)的数据集重复问题。为了寻找并评估最佳的重复数据检索方法,我们采用 LMD 的 Clean MIDI 子集作为基准测试集,其中同一歌曲的不同版本被分组在一起。我们首先评估了基于规则的方法和先前的符号音乐检索模型用于去重,并研究了一种基于对比学习的 BERT 模型,通过多种数据增强来查找重复文件。最终,我们提出了 LMD 的三个不同版本的过滤列表,在最保守的设置下,从 178,561 个文件中至少过滤掉了 38,134 个样本。
引用
@article{arxiv.2509.16662,
title = {On the de-duplication of the Lakh MIDI dataset},
author = {Eunjin Choi and Hyerin Kim and Jiwoo Ryu and Juhan Nam and Dasaem Jeong},
journal= {arXiv preprint arXiv:2509.16662},
year = {2025}
}
备注
The paper has been accepted for publication at ISMIR 2025