中文

精确且简洁的音频到乐谱对齐

声音 2026-05-20 v1

摘要

音频到乐谱对齐是音乐信息检索中一个长期存在的挑战,并且可以说是音乐研究中应用最广泛的对齐任务。对齐算法匹配同一音乐作品的两个版本,而要实现这一点,这些版本需要具有可比的格式。音频到音频对齐匹配音频特征;当将音频文件与乐谱匹配时,它们必须合成乐谱或通过钢琴卷帘或类似特征序列导出类似音频的特征。相比之下,符号对齐匹配以符号编码的音符;在音频到乐谱的场景中,这些音符将通过音频文件的转录获得。在本文中,我们提出了一种直接桥接类音频特征和符号级特征的算法。编码音符起始点和频谱激活的序列音频特征,通过一个源自符号对齐方法的定制动态规划匹配算法,与乐谱位置进行匹配。由此产生的方法既精确——超越了广泛使用的基于合成乐谱的音频到音频方法——又在其数字信号处理组件上保持灵活,即该方法可适应多样的音色特征,无需单独的转录模型。此外,它继承了符号对齐在运行时间上的一些优势,其算法复杂度在最坏情况下与(通常较短的)符号乐谱和(通常较长的)音频特征序列的长度呈线性关系。在后续章节中,我们提供了详细的算法描述,并在一个大规模钢琴独奏录音数据集上评估了其对齐质量。

关键词

引用

@article{arxiv.2605.20014,
  title  = {Precise and Simple Audio-to-Score Alignment},
  author = {Silvan Peter and Patricia Hu and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2605.20014},
  year   = {2026}
}

备注

published at the Music Encoding Conference (MEC) 2026