基于多模态度量学习的标签音乐检索
信息检索
2020-11-02 v1 多媒体
声音
音频与语音处理
摘要
基于标签的音乐检索对于高效浏览大规模音乐库至关重要。因此,自动音乐标注已被积极研究,主要作为分类任务,其存在固有局限:固定词表。另一方面,度量学习通过使用预训练词嵌入作为辅助信息,实现了灵活的词表。此外,度量学习已通过在其他领域(如文本到图像)联合学习多模态嵌入空间,证明了其适用于跨模态检索任务。本文中,我们探究了三条成功将多模态度量学习引入基于标签的音乐检索的思路:精细三元组采样、声学与文化音乐信息,以及领域特定词嵌入。实验结果表明,所提思路在定量与定性上均提升了检索系统。此外,我们发布了 MSD500,其为百万歌曲数据集(MSD)的一个子集,包含 500 个清洗后的标签、7 个人工标注的标签类别以及用户偏好档案。
引用
@article{arxiv.2010.16030,
title = {Multimodal Metric Learning for Tag-based Music Retrieval},
author = {Minz Won and Sergio Oramas and Oriol Nieto and Fabien Gouyon and Xavier Serra},
journal= {arXiv preprint arXiv:2010.16030},
year = {2020}
}
备注
5 pages, 2 figures, submitted to ICASSP 2021