面向自动鼓转录的真实合成数据
声音
2026-01-15 v1 人工智能
摘要
深度学习模型定义了自动鼓转录(ADT)的最新技术水平,但其性能依赖于大规模、成对的音频-MIDI数据集,而这些数据集十分稀缺。现有的使用合成数据的变通方法通常引入显著的领域差距,因为它们通常依赖于缺乏声学多样性的低保真SoundFont库。虽然高质量的单次采样样本提供了更好的替代方案,但它们并未以适合训练的标准化、大规模格式提供。本文介绍了一种新的ADT范式,它规避了对成对音频-MIDI训练数据的需求。我们的主要贡献是一种半监督方法,用于从未标记的音频源中自动整理出一个大型且多样化的单次鼓采样样本语料库。然后,我们使用该语料库仅从MIDI文件合成一个高质量数据集,并用其训练一个序列到序列的转录模型。我们在ENST和MDB测试集上评估了我们的模型,它取得了新的最先进结果,显著优于完全监督方法和先前的合成数据方法。复现我们实验的代码已在https://github.com/pier-maker92/ADT_STR上公开。
引用
@article{arxiv.2601.09520,
title = {Towards Realistic Synthetic Data for Automatic Drum Transcription},
author = {Pierfrancesco Melucci and Paolo Merialdo and Taketo Akama},
journal= {arXiv preprint arXiv:2601.09520},
year = {2026}
}