中文

多视图自监督方法在音乐标签标注中的实验比较

声音 2024-04-16 v1 机器学习 音频与语音处理

摘要

自监督学习已成为一种在大量无标签数据上预训练可泛化机器学习模型的强大方法。它在音乐领域尤其引人注目,因为获取有标签数据耗时、易错且模糊不清。在自监督过程中,模型在预置任务上进行训练,其主要目标是获取鲁棒且信息丰富的特征,这些特征随后可针对特定下游任务进行微调。预置任务的选择至关重要,因为它引导模型通过有意义的约束来塑造特征空间以进行信息编码。在音乐领域,大多数工作都依赖于对比学习或掩码技术。在本研究中,我们通过调查和比较新的自监督方法在音乐标签标注中的性能,扩展了应用于音乐的预置任务范围。我们开源了一个在包含数百万首曲目的多样化目录上训练的简单 ResNet 模型。我们的结果表明,尽管大多数这些预训练方法在下游任务中产生了相似的结果,但与其他自监督预训练方法相比,对比学习始终能带来更好的下游性能。这在有限数据量的下游任务场景中同样成立。

关键词

引用

@article{arxiv.2404.09177,
  title  = {An Experimental Comparison Of Multi-view Self-supervised Methods For Music Tagging},
  author = {Gabriel Meseguer-Brocal and Dorian Desblancs and Romain Hennequin},
  journal= {arXiv preprint arXiv:2404.09177},
  year   = {2024}
}