音乐词嵌入用于音乐标签化与检索
声音
2024-04-24 v2 音频与语音处理
摘要
词嵌入已成为文本信息检索中不可或缺的手段。通常,词嵌入是从大量通用且非结构化文本数据中学习的。然而,在音乐领域,词嵌入可能难以理解音乐语境或识别与歌手、曲目等音乐相关实体。为此,我们提出了一种新方法,即音乐词嵌入 (MWE),该方法通过从包括日常用语和音乐相关词汇在内的各种文本中进行学习。我们将MWE集成到用于标签化和检索音乐的音频-词联合表示框架中,使用具有不同音乐特异性水平的词汇,如标签、歌手和曲目。我们的实验表明,使用更具音乐特异性的词汇(如曲目)可获得更好的检索性能,而使用较不具特异性的词汇(如标签)则可获得更好的标签化性能。为平衡这一权衡,我们建议采用多原型训练,即联合使用不同音乐特异性水平的词汇。我们对词嵌入和音频-词联合嵌入在四个任务(标签排序预测、音乐标签化、按标签检索、按曲目检索)上进行了评估,这些任务分别基于两个数据集(Million Song Dataset 和 MTG-Jamendo)进行。我们的发现表明,所提出的MWE比传统词嵌入更高效且更稳健。
引用
@article{arxiv.2404.13569,
title = {Musical Word Embedding for Music Tagging and Retrieval},
author = {SeungHeon Doh and Jongpil Lee and Dasaem Jeong and Juhan Nam},
journal= {arXiv preprint arXiv:2404.13569},
year = {2024}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)