面向音乐起音检测的高效深度学习模型
声音
2018-06-20 v2 信息检索
音频与语音处理
摘要
本文提出了一种高效且可复现的用于音乐起音检测(MOD)的深度学习模型。我们首先回顾了 MOD 领域最先进的深度学习模型,并指出其不足与挑战:(i)缺乏超参数调优细节,(ii)无法获取在其他数据集上训练模型的代码,以及(iii)在比较不同架构时忽略了网络能力。考虑到上述问题,我们使用七种深度学习架构进行了实验。其中最高效的架构达到了与我们实现的最先进架构相当的性能,但其可训练参数总数仅为最先进架构的 28.3%。我们的实验使用了两个不同的数据集:一个主要由器乐音乐片段组成,另一个由我们自行开发、仅包含独唱人声片段的数据集。此外,我们还进行了跨数据集迁移学习实验。结果表明,在一个数据集上预训练的模型无法在另一个数据集上检测起音,这说明提供实现代码以便针对不同数据集重新训练模型的重要性。数据集、代码以及运行在 Google Colab 上的 Jupyter notebook 均已公开,以使本研究易于理解并方便复现。
引用
@article{arxiv.1806.06773,
title = {Towards an efficient deep learning model for musical onset detection},
author = {Rong Gong and Xavier Serra},
journal= {arXiv preprint arXiv:1806.06773},
year = {2018}
}
备注
Paper rejected by the 19th International Society for Music Information Retrieval Conference