中文

面向钢琴谱的实用端到端光学乐谱识别

计算机视觉与模式识别 2024-10-17 v1

摘要

光学乐谱识别 (OMR) 近期的大部分进展是通过深度学习方法取得的,特别是遵循端到端范式的模型,它们读取输入图像并产生线性的标记序列。不幸的是,许多乐谱,尤其是钢琴乐谱,无法轻易转换为线性序列。这导致 OMR 研究人员使用自定义的线性化编码,而不是被广泛接受的音乐记谱结构化格式。它们的多样性使得直接比较 OMR 系统的性能变得困难。为了使近期的 OMR 模型进展更接近实用成果:(a) 我们定义了一种称为线性化 MusicXML 的顺序格式,允许直接训练端到端模型,并与行业标准 MusicXML 格式保持紧密的连贯性和兼容性。(b) 我们基于 OpenScore Lieder 语料库,创建了一个用于基准测试排版 OMR 的开发集和测试集,其中包含 MusicXML 真实标注。它们包含 1,438 和 1,493 个钢琴谱系统,每个系统都有一张来自 IMSLP 的图像。(c) 我们训练并微调了一个端到端模型,作为该数据集上的基线,并采用 TEDn 指标来评估该模型。我们还针对最近发布的合成钢琴谱数据集 GrandStaff 测试了我们的模型,并超越了最先进的结果。

关键词

引用

@article{arxiv.2403.13763,
  title  = {Practical End-to-End Optical Music Recognition for Pianoform Music},
  author = {Jiří Mayer and Milan Straka and Jan Hajič and Pavel Pecina},
  journal= {arXiv preprint arXiv:2403.13763},
  year   = {2024}
}

备注

15+4 pages, 6 figures