利用 wav2vec 2.0 学习音乐表征
音频与语音处理
2022-10-28 v1 声音
摘要
学习通用的音乐表征提供了使用较小数据集微调多个下游任务的灵活性。wav2vec 2.0 语音表征模型在许多下游语音任务中显示出有前景的结果,但在适应音乐时效果较差。在本文中,我们评估了直接在音乐数据上预训练 wav2vec 2.0 是否是比微调语音模型更好的解决方案。我们说明,当在音乐数据上预训练时,离散的潜在表征能够编码诸如音高和乐器等音乐概念的语义信息。我们的结果表明,微调在音乐数据上预训练的 wav2vec 2.0 使我们能够在音乐分类任务上取得有前景的结果,这些结果与先前关于音频表征的工作具有竞争力。此外,这些结果优于在语音嵌入上预训练的模型,表明在音乐数据上预训练的 wav2vec 2.0 可以成为一个有前景的音乐表征模型。
引用
@article{arxiv.2210.15310,
title = {Learning Music Representations with wav2vec 2.0},
author = {Alessandro Ragano and Emmanouil Benetos and Andrew Hines},
journal= {arXiv preprint arXiv:2210.15310},
year = {2022}
}
备注
Submitted to ICASSP 2023