中文

Count The Notes:基于直方图监督的自动音乐转谱

声音 2025-11-19 v1 机器学习

摘要

自动音乐转谱(AMT)将音频录音转换为符号化的音乐表示。为 AMT 训练深度神经网络(DNN)通常需要与精确帧级注释对齐的训练对。由于创建此类数据集在许多音乐情境中昂贵且不切实际,,因此使用分段级注释的弱对齐方法日益受到关注。然而,现有方法常依赖动态时间变形(DTW)或软对齐损失函数,两者都需要局部语义对应关系,容易出错且计算成本高昂。本文引入 CountEM,一种新的 AMT 框架,通过利用音符事件直方图作为监督,消除对显式局部对齐的需求,从而实现轻计算和更大的灵活性。使用期望最大化(EM)方法,CountEM 仅依据音符发生次数迭代细化预测,显著减少标注工作,同时保持高转谱准确性。实验在钢琴、吉他和多乐器数据集上表明,CountEM 与现有弱监督方法相当或更好,提高了 AMT 的鲁棒性、可扩展性和效率。我们的项目页面位于 https://yoni-yaffe.github.io/count-the-notes。

关键词

引用

@article{arxiv.2511.14250,
  title  = {Count The Notes: Histogram-Based Supervision for Automatic Music Transcription},
  author = {Jonathan Yaffe and Ben Maman and Meinard Müller and Amit H. Bermano},
  journal= {arXiv preprint arXiv:2511.14250},
  year   = {2025}
}

备注

ISMIR 2025