音乐表示的对比学习
声音
2021-09-28 v2 机器学习
音频与语音处理
摘要
尽管深度学习在许多音乐领域带来了巨大进步,但带标签的音乐数据集仍尤为难以创建、昂贵且耗时。在本工作中,我们将SimCLR引入音乐领域,并提出一套大型音频数据增强链,以构成一个用于音乐表示自监督对比学习的简单框架:CLMR。该方法作用于原始时域音乐数据,且无需标签即可学习有用表示。我们在MagnaTagATune与Million Song数据集上的音乐分类下游任务中评估CLMR,并给出消融研究以检验我们对SimCLR的音乐相关改进中哪些最为有效。在所提表示上训练的线性分类器在MagnaTagATune数据集上取得了比监督模型更高的平均精度,并在Million Song数据集上表现相当。此外,我们表明CLMR的表示可使用域外数据集迁移,说明我们的方法在音乐分类中具有强泛化能力。最后,我们展示所提方法允许在较小标签数据集上进行数据高效学习:在线性评估中,尽管在MagnaTagATune数据集中仅使用了259首带标签歌曲(完整数据集的1%),我们仍取得了33.1%的平均精度。为促进可复现性及未来关于音乐自监督学习的研究,我们公开发布了本文所有实验的预训练模型与源代码。
引用
@article{arxiv.2103.09410,
title = {Contrastive Learning of Musical Representations},
author = {Janne Spijkervet and John Ashley Burgoyne},
journal= {arXiv preprint arXiv:2103.09410},
year = {2021}
}
备注
15 pages, 8 figures. In Proceedings of the 22nd International Society for Music Information Retrieval Conference, ISMIR, 2021