中文

谱图重建对自动音乐转录的影响:一种提升转录精度的替代方法

声音 2020-10-21 v1 机器学习 音频与语音处理

摘要

大多数最先进的自动音乐转录(AMT)模型将主要转录任务拆解为起始预测与结束预测等子任务,并使用起始与结束标签进行训练。这些预测随后被拼接在一起,作为另一模型的输入,配合音高标签训练以得到最终转录。我们尝试仅使用音高标签(连同谱图重建损失),并探究在不引入有监督子任务的情况下该模型能达到何种程度。本文不旨在实现最先进的转录精度,而是探究谱图重建对我们的 AMT 模型所产生的影响。我们提出的模型由两个 U-net 组成:第一个 U-net 将谱图转录为后验图,第二个 U-net 将后验图变换回谱图。在原始谱图与重建谱图之间施加重建损失,以约束第二个 U-net 仅关注重建。我们在三个不同数据集上训练模型:MAPS、MAESTRO 与 MusicNet。实验表明,与不含重建部分的同模型相比,添加重建损失通常能提升音符级转录精度。此外,它还能将帧级查准率提升至高于最先进模型。我们的 U-net 所学到的特征图包含网格状结构(基线模型中不存在),这意味着在有重建损失存在时,模型可能试图沿时间与频率轴同时进行计数,从而带来更高的音符级转录精度。

关键词

引用

@article{arxiv.2010.09969,
  title  = {The Effect of Spectrogram Reconstruction on Automatic Music Transcription: An Alternative Approach to Improve Transcription Accuracy},
  author = {Kin Wai Cheuk and Yin-Jyun Luo and Emmanouil Benetos and Dorien Herremans},
  journal= {arXiv preprint arXiv:2010.09969},
  year   = {2020}
}

备注

Accepted in ICPR