Transcoda:基于数据中心合成训练的端到端零样光学音乐识别
计算机视觉与模式识别
2026-05-12 v1 机器学习
摘要
光学音乐识别(OMR)是将乐谱转换为结构化文本表示的任务,目前受限于缺乏大规模实扫描数据的标注数据集。这迫使模型依赖 few-shot transfer 或仍显得过于简单的人工合成训练管线。次要挑战在于编码非唯一性:流行的 Humdrum **kern 格式在转换乐谱时,多个不同的文本编码可渲染为相同的视觉乐谱。这种一对多映射制造了更难的学习任务,并在解码过程中引入高不确定性。我们提出 Transcoda,一种基于(i)先进的人工合成数据生成管线、(ii)对 **kern 编码进行标准化以强制唯一标准形式、(iii)基于语法的解码以确保输出的语法正确性的 OMR 系统。该方法允许我们仅用 6 小时在单块 GPU 上训练一个仅 5900 万参数的模型,超越了十亿参数的基线模型。在新编织合成谱子基准测试中,Transcoda 以 18.46% 的 OMR-NED 成绩位居榜首(与下一名 Legato 的 43.91% 相比),将历史波兰扫描的错误率降至 63.97% OMR-NED(较 SMT++ 的 80.16% 显著降低)。
引用
@article{arxiv.2605.10835,
title = {Transcoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic Training},
author = {Daniel Dratschuk and Paul Swoboda},
journal= {arXiv preprint arXiv:2605.10835},
year = {2026}
}
备注
13 pages, 7 figures