Onsets与Frames:双目标钢琴转录
声音
2018-06-06 v2 机器学习
音频与语音处理
机器学习
摘要
我们通过使用深度卷积与循环神经网络推进了复调钢琴音乐转录的最先进水平,该网络被训练以联合预测onsets与frames。我们的模型预测音高onset事件,然后利用这些预测来条件化逐帧音高预测。在推理期间,我们通过不允许新音符开始(除非onset检测器也同意该音高在该帧中存在onset)来限制逐帧检测器的预测。我们专注于共同改进onsets与offsets,而非孤立地改进任一方,因为我们认为这与人类音乐感知更相关。我们的方法在MAPS数据集上带来了超过100%的相对音符F1分数(含offsets)提升。此外,我们扩展模型以预测归一化音频的相对速度,从而产生更自然的听感转录。
引用
@article{arxiv.1710.11153,
title = {Onsets and Frames: Dual-Objective Piano Transcription},
author = {Curtis Hawthorne and Erich Elsen and Jialin Song and Adam Roberts and Ian Simon and Colin Raffel and Jesse Engel and Sageev Oore and Douglas Eck},
journal= {arXiv preprint arXiv:1710.11153},
year = {2018}
}
备注
Examples available at https://goo.gl/magenta/onsets-frames-examples