用于音乐结构特征的有监督度量学习
音频与语音处理
2022-05-03 v2 声音
摘要
音乐结构分析 (MSA) 方法传统上在音频中搜索具有音乐意义的模式:同质性、重复性、新颖性和段落长度规律性。诸如 MFCC 或色度图等手工设计的音频特征常被用来提取这些模式。然而,随着段落标签(例如,主歌、副歌和桥段)标注的增多,人们可以使用有监督特征学习使这些模式更加清晰并提升 MSA 性能。为此,我们采用有监督度量学习方法:我们训练一个深度神经网络,对于两个频谱图输入,若根据标注它们具有相同段落类型,则输出彼此相近的嵌入,否则相远。我们提出了一种批次采样方案,以确保训练对中的标签被有意义地解释。训练好的模型提取的特征可用于现有的 MSA 算法。在三个数据集(HarmonixSet、SALAMI 和 RWC)上的评估中,我们证明在数据集内和跨数据集场景下,使用所提特征能显著提升传统 MSA 算法的性能。
引用
@article{arxiv.2110.09000,
title = {Supervised Metric Learning for Music Structure Features},
author = {Ju-Chiang Wang and Jordan B. L. Smith and Wei-Tsung Lu and Xuchen Song},
journal= {arXiv preprint arXiv:2110.09000},
year = {2022}
}
备注
This paper was accepted and presented at ISMIR 2021