音乐推荐系统中预训练音频表示的比较分析
信息检索
2024-09-16 v1
摘要
多年来,音乐信息检索(MIR)领域提出了多种在大规模音乐数据上预训练的模型。迁移学习展示了预训练后端模型在广泛下游任务(包括自动标签和流派分类)中的有效性。然而,MIR 论文通常不探索预训练模型在音乐推荐系统(MRS)中的效率。此外,推荐系统社区倾向于使用传统的端到端神经网络学习,而非这些模型。我们的研究填补了这一空白,评估了六种预训练后端模型(MusicFM、Music2Vec、MERT、EncodecMAE、Jukebox 和 MusiCNN)在 MRS 中的适用性。我们使用三种推荐模型评估它们的性能:K-近邻(KNN)、浅层神经网络和 BERT4Rec。我们的研究结果表明,预训练音频表示在传统 MIR 任务和 MRS 之间表现出显著的性能差异,这表明后端模型捕获的音乐信息中有价值的方面可能因任务而异。本研究为进一步探索预训练音频表示以增强音乐推荐系统奠定了基础。
引用
@article{arxiv.2409.08987,
title = {Comparative Analysis of Pretrained Audio Representations in Music Recommender Systems},
author = {Yan-Martin Tamm and Anna Aljanaki},
journal= {arXiv preprint arXiv:2409.08987},
year = {2024}
}