中文

基于度量的多模态深度学习驱动组装的img2Mxml:从乐谱图像生成MusicXML

计算机视觉与模式识别 2021-06-24 v1

摘要

深度学习近来已应用于光学音乐识别(OMR)。然而,目前针对各类乐谱图像的OMR处理仍缺乏广泛适用性所需的精度。在此,我们提出一种MMdA(基于度量的多模态深度学习(DL)驱动组装)方法,可实现从各类图像(包括倾斜照片图像)的端到端OMR处理。该方法利用深度学习模型提取小节,对其进行对齐与缩放,以便通过多个深度学习模型串行或并行推断给定的音乐符号成分。每个标准化小节的使用使得模型的高效训练与每小节五条谱线的精确调整成为可能。具有少量特征类型的多个音乐符号成分类别模型可表示包括和弦在内的多样化音符及其他音乐符号。该MMdA方法为高精度端到端OMR处理提供了解决方案。

关键词

引用

@article{arxiv.2106.12037,
  title  = {Listen to Your Favorite Melodies with img2Mxml, Producing MusicXML from Sheet Music Image by Measure-based Multimodal Deep Learning-driven Assembly},
  author = {Tomoyuki Shishido and Fehmiju Fati and Daisuke Tokushige and Yasuhiro Ono},
  journal= {arXiv preprint arXiv:2106.12037},
  year   = {2021}
}

备注

19 pages, 7 figures