中文

为音乐源分离减些 Slakh:一个用于研究训练数据质量与数量影响的数据集

声音 2019-09-19 v1 机器学习 音频与语音处理

摘要

近年来,随着基于深度学习的方法的出现,音乐源分离性能已大幅提升。此类方法通常需要大量带标签的训练数据,就音乐而言,这些数据由混合音频及相应的乐器 stems 组成。然而,大多数商业音乐无法获得 stems,且迄今仅有限的数据集被公开释放。因此,在比较各种源分离方法时很难得出结论,因为性能差异可能既源于更好的数据增强技术或缓解训练数据有限性的训练技巧,也源于本质上更优的模型架构与目标函数。本文中,我们提出合成 Lakh 数据集(Slakh)作为音乐源分离研究的新工具。Slakh 由使用专业级基于样本的虚拟乐器从 Lakh MIDI 数据集(LMD)生成的高质量器乐混合音频及相应 stems 渲染而成。首个版本 Slakh2100 聚焦于 2100 首歌曲,产生 145 小时的混合音频。尽管由于纯器乐而不完全可比,该数据集包含比该领域事实标准数据集 MUSDB18 多一个数量级的数据。我们表明 Slakh 可有效扩充现有数据集用于乐器分离,同时为大量数据密集型的音乐信号分析任务打开大门。

关键词

引用

@article{arxiv.1909.08494,
  title  = {Cutting Music Source Separation Some Slakh: A Dataset to Study the Impact of Training Data Quality and Quantity},
  author = {Ethan Manilow and Gordon Wichern and Prem Seetharaman and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:1909.08494},
  year   = {2019}
}

备注

Accepted for publication at WASPAA 2019