基于音乐音频的多源对比学习
音频与语音处理
2023-05-12 v2 声音
摘要
对比学习构成了自监督学习的一个新兴分支,其利用大量未标记数据,通过学习一个潜在空间,将同一样本的不同视图对关联起来。在本文中,我们提出将音乐源关联作为对比音乐表示学习中的成对生成策略。为此,我们修改了广泛使用的对比学习音频框架COLA,以学习将歌曲片段与随机选定并自动提取的人声或器乐源相关联。我们进一步引入了对对比损失的一种新颖修改,以纳入关于特定源存在或缺失的信息。我们使用公开可用的Magna-Tag-A-Tune (MTAT)作为源数据集,在三个不同下游任务(音乐自动标注、乐器分类和音乐流派分类)中的实验评估取得了与现有文献方法相竞争的结果,以及更快的网络收敛。结果还表明,该预训练方法可根据所选音乐源导向特定特征,同时也依赖于分离源的质量。
引用
@article{arxiv.2302.07077,
title = {Multi-Source Contrastive Learning from Musical Audio},
author = {Christos Garoufis and Athanasia Zlatintsi and Petros Maragos},
journal= {arXiv preprint arXiv:2302.07077},
year = {2023}
}
备注
8 pages, 4 figures, 3 tables. Camera-ready submission at SMC23