中文

基于 RNN 自动音乐转写的钢琴音乐音频到乐谱对齐

声音 2017-11-15 v1 音频与语音处理

摘要

我们提出一种用于钢琴演奏音频到乐谱对齐的框架,其采用基于神经网络的自动音乐转写(AMT)。尽管 AMT 结果可能包含一些错误,但音符预测输出可视为一种学习到的特征表示,可直接与 MIDI 音符或 chroma 表示比较。为此,我们采用两个循环神经网络作为基于 AMT 的特征提取器用于对齐算法。其中一个在帧级别预测 88 个音符或 12 个 chroma 的存在,另一个检测 12 个 chroma 中的音符起始。我们将两类学习到的特征结合用于音频到乐谱对齐。为可比性,我们应用动态时间规整作为对齐算法,无任何额外后处理。我们在 MAPS 数据集上评估所提框架,并与先前工作比较。结果表明,带有学习特征的该对齐框架显著提高了精度,平均起始误差小于 10 ms。

关键词

引用

@article{arxiv.1711.04480,
  title  = {Audio-to-score alignment of piano music using RNN-based automatic music transcription},
  author = {Taegyun Kwon and Dasaem Jeong and Juhan Nam},
  journal= {arXiv preprint arXiv:1711.04480},
  year   = {2017}
}

备注

6 pages, 5 figures, The paper was published in SMC 2017 proceedings, Proceedings of 14th Sound and Music Computing Conference (SMC). 2017