中文

ADTOF:用于自动鼓点转录的大型非合成音乐数据集

声音 2021-11-24 v1 音频与语音处理

摘要

在存在旋律乐器情况下的鼓点转录(DTM)最优方法是以监督方式训练的机器学习模型,这意味着它们依赖于标注数据集。问题在于,现有的公开数据集在规模或真实感上均有限,因而用于训练并不理想。事实上,目前最佳结果是通过一种相当复杂的多步训练流程获得的,该流程同时涉及真实与合成数据集。为解决此问题,我们从节奏游戏玩家社区提供大量标注数据这一观察出发,策划了一个新的众包鼓点转录数据集。该数据集包含真实世界音乐,经人工标注,且规模约为其他任何非合成数据集的两个数量级之大,使其成为训练用途的首选。然而,由于众包,初始标注包含错误。我们讨论了如何通过自动纠正不同类型的错误来提升数据集质量。当用于训练一个流行的 DTM 模型时,该数据集取得的性能与 DTM 当前最优水平相当,从而证明了标注的质量。

关键词

引用

@article{arxiv.2111.11737,
  title  = {ADTOF: A large dataset of non-synthetic music for automatic drum transcription},
  author = {Mickael Zehren and Marco Alunno and Paolo Bientinesi},
  journal= {arXiv preprint arXiv:2111.11737},
  year   = {2021}
}

备注

Proceedings of the 22nd International Society for Music Information Retrieval Conference, ISMIR, Online, pp. 818-824