LadderSym:用于音乐练习错误检测的多模态交错Transformer
声音
2026-03-05 v2 人工智能
音频与语音处理
摘要
音乐学习者从能够准确检测练习中错误的工具方面获益良多。现有方法通常通过启发式方法或可学习模型将音频录音与音乐谱面进行比较。本文引入LadderSym,一种新的基于Transformer的方法用于音乐错误检测。LadderSym基于对现有先进方法的两个关键观察:(1)晚期融合限制了跨流之间的对齐能力和跨模态比较;(2)依赖谱面音频会在频谱中引入歧义,降低了包含并列音符的音乐表现力。为解决这些限制,LadderSym引入(1)两个流的编码器,搭配跨流对齐模块以提升音频比较能力和错误检测F1分数;(2)一种多模态策略,利用音频和符号谱面,采用符号表示作为解码器提示,以减少歧义并提升F1分数。我们在MAESTRO-E和CocoChorales-E数据集上进行评估,通过衡量每个音符类别的F1分数。与先前的最佳方法相比,LadderSym在MAESTRO-E上未命中音符的F1分数提升至56.3%(原26.8%),额外音符检测提升14.4分(72.0%→86.4%)。在CocoChorales-E上也观察到类似的提升。此外,我们还对我们精心挑选的真实数据进行了评估。本工作提供关于序列评估任务的比较模型见解,适用于强化学习、人类技能评估及模型评估。代码:https://github.com/ben2002chou/LadderSYM
关键词
引用
@article{arxiv.2510.08580,
title = {LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection},
author = {Benjamin Shiue-Hal Chou and Purvish Jajal and Nick John Eliopoulos and James C. Davis and George K. Thiruvathukal and Kristen Yeon-Ji Yun and Yung-Hsiang Lu},
journal= {arXiv preprint arXiv:2510.08580},
year = {2026}
}
备注
Accepted to ICLR 2026