中文

面向跨模态艺人检索的对比学习

信息检索 2023-08-15 v1

摘要

音乐检索与推荐应用通常依赖于编码为嵌入向量的内容特征,这些嵌入提供了音乐数据集中条目的向量表示。通过对最初以多种模态表示的条目(例如音频信号、用户交互数据或编辑数据)进行处理,可以推导出众多互补的嵌入。然而,在任何音乐数据集中,任一给定模态的数据可能并非对所有条目都可用。在本工作中,我们提出一种基于对比学习的方法来组合多模态嵌入,并探究在艺人相似度任务中来自不同模态的嵌入存在或缺失的影响。在两个数据集上的实验表明,无论在艺人检索准确率还是覆盖率方面,我们的对比方法都优于单模态嵌入以及组合模态的基线算法。相对于其他方法的提升对于热度较低的查询艺人尤为显著。我们证明了我们的方法成功组合了来自不同模态的互补信息,并且对缺失模态数据更具鲁棒性(即,它更好地处理了检索具有与查询艺人不同模态嵌入的艺人)。

关键词

引用

@article{arxiv.2308.06556,
  title  = {Contrastive Learning for Cross-modal Artist Retrieval},
  author = {Andres Ferraro and Jaehun Kim and Sergio Oramas and Andreas Ehmann and Fabien Gouyon},
  journal= {arXiv preprint arXiv:2308.06556},
  year   = {2023}
}