用于音乐理解的有监督与无监督音频表示学习
声音
2022-10-11 v1 人工智能
信息检索
机器学习
多媒体
音频与语音处理
摘要
在这项工作中,我们对音乐领域中多个任务的音频理解模型预训练策略进行了广泛的比较分析,包括流派、时代、起源、情绪、配器、调性、音高、人声特征、节奏和音质的标注。具体而言,我们探究了预训练数据集的领域(音乐或通用音频)以及预训练方法(有监督或无监督)如何影响所得音频嵌入对下游任务的适用性。我们表明,在大规模专家标注的音乐数据集上通过有监督学习训练的模型在广泛的音乐标注任务中达到了最先进的性能,这些任务各自具有新颖的内容和词汇。这可以以高效的方式实现,模型参数量少于 1 亿且无需为下游任务进行微调或重参数化,使该方法对工业级音频目录具有实用性。在无监督学习策略类别中,我们表明训练数据集的领域会显著影响模型所学表示的性能。我们发现,将预训练数据集的领域限定为音乐,可在更小的批大小下训练,同时在无监督学习——以及某些情况下的有监督学习——中达到音乐理解的最先进水平。我们还证实,尽管在许多任务上达到了最先进性能,有监督学习可能导致模型专门化于所提供的监督信息,在一定程度上损害模型的通用性。
引用
@article{arxiv.2210.03799,
title = {Supervised and Unsupervised Learning of Audio Representations for Music Understanding},
author = {Matthew C. McCallum and Filip Korzeniowski and Sergio Oramas and Fabien Gouyon and Andreas F. Ehmann},
journal= {arXiv preprint arXiv:2210.03799},
year = {2022}
}