基于瓶颈残余卷积的高精度光学音乐识别方法
计算机视觉与模式识别
2026-04-21 v1 机器学习
声音
音频与语音处理
摘要
光学音乐识别(OMR)旨在将印刷或手写音乐谱面图像转换为可编辑的符号表示。本文提出了一种基于残差瓶颈卷积和基于双向门控循环单元(BiGRU)的序列建模的端到端OMR框架。使用采用ResNet-v2风格残余瓶颈块和多尺度膨胀卷积的卷积神经网络,用于提取编码细粒度符号细节和全局乐谱线结构的特征。提取的特征序列随后输入到BiGRU网络中,以建模音乐符号之间的时间依赖性。该模型使用Connectionist Temporal Classification loss进行训练,实现端到端预测,无需显式对齐标注。在Camera-PrIMuS和PrIMuS数据集上的实验结果表明,所提出框架的有效性。在Camera-PrIMuS上,所提方法实现了序列错误率(SeER)为,符号错误率(SyER)为,分别实现音高、类型和音符准确率为、和。平均训练时间为1.74~秒/epoch,表明在保持强识别性能的同时具有高计算效率。在PrIMuS上,该方法实现了SeER为和SyER为,分别实现音高、类型和音符准确率为、和。进一步的细粒度错误分析进一步确认了所提模型的有效性。
引用
@article{arxiv.2604.16446,
title = {A High-Accuracy Optical Music Recognition Method Based on Bottleneck Residual Convolutions},
author = {Junwen Ma and Huhu Xue and Xingyuan Zhao and and Weicheng Fu},
journal= {arXiv preprint arXiv:2604.16446},
year = {2026}
}
备注
2 figs, and 13 tables