LEGATO:面向排版乐谱光学音乐识别的大规模端到端可泛化方法
计算机视觉与模式识别
2025-10-03 v2 数字图书馆
摘要
我们提出了 Legato,一种用于光学音乐识别 (OMR) 的新型端到端模型,该任务是将乐谱图像转换为机器可读文档。Legato 是第一个能够识别整页或多页排版乐谱的大规模预训练 OMR 模型,也是第一个生成 ABC 记谱法(一种简洁、人类可读的符号音乐格式)文档的模型。通过将预训练的视觉编码器与在超过 214K 图像数据集上训练的 ABC 解码器相结合,我们的模型表现出跨各种排版乐谱的强大泛化能力。我们在一系列数据集和指标上进行了全面实验,并证明 Legato 优于先前的最先进技术。在我们最真实的数据集上,我们在标准指标 TEDn 和 OMR-NED 上分别看到了 68% 和 47.6% 的绝对错误率降低。
引用
@article{arxiv.2506.19065,
title = {LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR},
author = {Guang Yang and Victoria Ebert and Nazif Tamer and Brian Siyuan Zheng and Luiza Pozzobon and Noah A. Smith},
journal= {arXiv preprint arXiv:2506.19065},
year = {2025}
}