中文

基于瓶颈残余卷积的高精度光学音乐识别方法

计算机视觉与模式识别 2026-04-21 v1 机器学习 声音 音频与语音处理

摘要

光学音乐识别(OMR)旨在将印刷或手写音乐谱面图像转换为可编辑的符号表示。本文提出了一种基于残差瓶颈卷积和基于双向门控循环单元(BiGRU)的序列建模的端到端OMR框架。使用采用ResNet-v2风格残余瓶颈块和多尺度膨胀卷积的卷积神经网络,用于提取编码细粒度符号细节和全局乐谱线结构的特征。提取的特征序列随后输入到BiGRU网络中,以建模音乐符号之间的时间依赖性。该模型使用Connectionist Temporal Classification loss进行训练,实现端到端预测,无需显式对齐标注。在Camera-PrIMuS和PrIMuS数据集上的实验结果表明,所提出框架的有效性。在Camera-PrIMuS上,所提方法实现了序列错误率(SeER)为7.52%7.52\%,符号错误率(SyER)为0.45%0.45\%,分别实现音高、类型和音符准确率为99.33%99.33\%99.60%99.60\%99.28%99.28\%。平均训练时间为1.74~秒/epoch,表明在保持强识别性能的同时具有高计算效率。在PrIMuS上,该方法实现了SeER为8.11%8.11\%和SyER为0.49%0.49\%,分别实现音高、类型和音符准确率为99.27%99.27\%99.58%99.58\%99.21%99.21\%。进一步的细粒度错误分析进一步确认了所提模型的有效性。

关键词

引用

@article{arxiv.2604.16446,
  title  = {A High-Accuracy Optical Music Recognition Method Based on Bottleneck Residual Convolutions},
  author = {Junwen Ma and Huhu Xue and Xingyuan Zhao and and Weicheng Fu},
  journal= {arXiv preprint arXiv:2604.16446},
  year   = {2026}
}

备注

2 figs, and 13 tables