基于卷积神经网络的符号音乐小节级段落边界检测
声音
2025-09-23 v1 机器学习
音频与语音处理
摘要
当前的音乐结构分析(MSA)方法主要集中于音频数据。虽然符号音乐可以合成为音频并使用现有的MSA技术进行分析,但这种方法并未利用符号音乐在音高、时间和乐器方面丰富的显式表示。MSA的一个关键子问题是段落边界检测——确定给定的时间点是否标志着音乐段落之间的过渡。在本文中,我们研究了符号音乐的自动段落边界检测。首先,我们引入了一个用于段落边界检测的人工标注MIDI数据集,该数据集包含我们从Lakh MIDI数据集中手动整理的6134个MIDI文件的元数据。其次,我们训练了一个深度学习模型,以分类固定长度音乐窗口内段落边界的存在。我们的数据表示涉及一种基于合成泛音的新颖编码方案,将任意MIDI乐器配置编码为3通道钢琴卷帘谱。我们的模型达到了0.77的F1分数,分别比类似的基于音频的监督学习方法和无监督的块匹配分割(CBM)音频方法提高了0.22和0.31。我们发布了我们的数据集、代码和模型。
引用
@article{arxiv.2509.16566,
title = {Barwise Section Boundary Detection in Symbolic Music Using Convolutional Neural Networks},
author = {Omar Eldeeb and Martin Malandro},
journal= {arXiv preprint arXiv:2509.16566},
year = {2025}
}