深度音乐转录模型中的声音与音乐偏差:系统性分析
声音
2026-01-27 v1 机器学习
摘要
自动音乐转录 (AMT) —— 将音频转换为音符表示的任务 —— 由于深度学习系统的推进,取得了快速进展。由于稀缺的丰富标注音乐数据集,AMT 的进展主要集中在古典钢琴音乐上,甚至是少数特定数据集。这些系统能否有效地针对其他音乐情境进行泛化仍是一个未解决的问题。补充最近关于声音(如录音条件)分布迁移的研究,本文我们关注音乐维度 —— 具体而言是曲风、动态和多音性水平的变化。为此,我们引入了 MDS 语料库,包含三个 distinct 子集 —— (1) 曲风 (Genre),(2) 随机 (Random),和 (3) MAEtest —— 来模拟不同的分布迁移轴。我们使用传统信息检索和音乐信息化绩效指标,对 MDS 语料库上几个最先进的 AMT 系统进行评估。我们的广泛评估隔离并暴露了在特定分布迁移下的特定绩效下降。特别是,我们测量由于声音导致的音符级 F1 绩效下降 20 个百分点,而由于曲风导致的下降为 14。总体而言,我们发现动态估计比 onset 预测更容易受到音乐变异的影响。音乐信息化评估指标,特别是捕获和谐结构的指标,帮助识别潜在贡献因素。此外,实验使用随机生成的非音乐序列揭示了在极端音乐分布迁移下系统绩效的明显局限。总体而言,这些发现提供了关于深度 AMT 系统中持续存在的语料偏差问题的新证据。
引用
@article{arxiv.2512.14602,
title = {Sound and Music Biases in Deep Music Transcription Models: A Systematic Analysis},
author = {Lukáš Samuel Marták and Patricia Hu and Gerhard Widmer},
journal= {arXiv preprint arXiv:2512.14602},
year = {2026}
}
备注
pre-print of the upcoming EURASIP JASM journal article