用于复调钢琴音乐转录的端到端神经网络
机器学习
2016-02-12 v2 机器学习
声音
摘要
我们提出了一种用于复调钢琴音乐转录的监督神经网络模型。该模型的架构类似于语音识别系统,包含一个声学模型和一个音乐语言模型。声学模型是一个神经网络,用于估计音频帧中各音高的概率。语言模型是一个循环神经网络,用于建模音高组合随时间变化的相关性。所提出的模型具有通用性,可用于转录复调音乐,且不对复调数量施加任何限制。声学模型和语言模型的预测通过一个概率图模型进行组合。输出变量的推理使用束搜索算法执行。我们进行了两组实验。我们研究了声学模型的各种神经网络架构,并研究了使用所提出的架构组合声学模型和音乐语言模型预测的效果。我们将基于神经网络的声学模型与两种流行的无监督声学模型进行了性能比较。结果表明,卷积神经网络声学模型在所有评估指标上均取得了最佳性能。我们还观察到应用音乐语言模型后性能有所提升。最后,我们提出了一种高效的束搜索变体,该变体在提升性能的同时将运行时间减少了一个数量级,使模型适用于实时应用。
引用
@article{arxiv.1508.01774,
title = {An End-to-End Neural Network for Polyphonic Piano Music Transcription},
author = {Siddharth Sigtia and Emmanouil Benetos and Simon Dixon},
journal= {arXiv preprint arXiv:1508.01774},
year = {2016}
}