中文

基于卷积序列到序列模型的光学音乐识别

计算机视觉与模式识别 2017-07-18 v1 信息检索 声音

摘要

光学音乐识别(OMR)是音乐信息检索中的一项重要技术。深度学习模型在 OMR 任务上展现出有前景的结果,但可用于训练此类模型的足够规模的符号级标注数据集尚不存在且难以开发。我们提出一种称为卷积序列到序列模型的深度学习架构,旨在迈向端到端可训练的 OMR 流程,并应用一种在乐谱整句而非单独标注的符号上训练的学习过程。该模型在一个人工生成的数据集上训练和评估,并采用了基于真实场景的多种图像增强。该数据集是 OMR 研究中首个公开可用且规模足以训练和评估深度学习模型的数据集。借助所引入的增强,实现了 81% 的音高识别准确率和 94% 的时值准确率,从而得到 80% 的音符级准确率。最后,将该模型与商用方法进行比较,显示出相较这些应用的巨大改进。

关键词

引用

@article{arxiv.1707.04877,
  title  = {Optical Music Recognition with Convolutional Sequence-to-Sequence Models},
  author = {Eelco van der Wel and Karen Ullrich},
  journal= {arXiv preprint arXiv:1707.04877},
  year   = {2017}
}

备注

ISMIR 2017