中文

端到端复调光学音乐识别的实证评估

计算机视觉与模式识别 2021-08-05 v1 机器学习 声音 音频与语音处理

摘要

先前的研究表明,神经架构能够以高准确率对单声部和主调音乐进行光学音乐识别 (OMR)。然而,钢琴和管弦乐谱经常出现复调段落,这为任务增加了第二个维度。单声部和主调音乐可以被描述为同节奏的,即具有单一的音乐节奏。另一方面,复调音乐可以被视为同时具有多个节奏序列或声部。我们首先引入了一个工作流程,用于从 MuseScore 论坛上公开可用的乐谱中创建适合端到端识别的大规模复调数据集。然后,我们为端到端复调 OMR 提出了两种新颖的公式化表述——一种将问题视为一种多任务二分类,另一种将其视为多序列检测。基于过去端到端 OMR 工作中提出的编码器-解码器架构和图像编码器,我们提出了两种新颖的解码器模型——FlagDecoder 和 RNNDecoder——分别对应这两种表述。最后,我们比较了这些端到端方法在复调 OMR 上的实证性能,并观察到我们的多序列检测解码器 RNNDecoder 达到了新的最优性能。

关键词

引用

@article{arxiv.2108.01769,
  title  = {An Empirical Evaluation of End-to-End Polyphonic Optical Music Recognition},
  author = {Sachinda Edirisooriya and Hao-Wen Dong and Julian McAuley and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2108.01769},
  year   = {2021}
}

备注

Accepted to ISMIR 2021