WikiMuTe:一个从网络获取的音乐音频语义描述数据集
计算与语言
2024-04-18 v1 信息检索
机器学习
声音
音频与语音处理
摘要
用于匹配自由文本与音乐的多模态深度学习技术在音乐信息检索(MIR)领域显示出有希望的结果。先前的工作通常基于大型专有数据,而公开可用的数据集数量少且规模小。在本研究中,我们提出了WikiMuTe,一个包含丰富音乐语义描述的新开放数据集。数据来源于维基百科涵盖音乐作品的大量文章目录。通过专用的文本挖掘流程,我们提取了涵盖与音乐内容相关的广泛主题(如流派、风格、情绪、乐器配置和速度)的长篇和短篇描述。为了展示该数据的用途,我们训练了一个联合学习文本和音频表示并执行跨模态检索的模型。该模型在两个任务上进行了评估:基于标签的音乐检索和音乐自动标注。结果表明,虽然我们的方法在多个任务上达到了最先进的性能,但根据训练所用数据的不同,性能仍然存在差异。
引用
@article{arxiv.2312.09207,
title = {WikiMuTe: A web-sourced dataset of semantic descriptions for music audio},
author = {Benno Weck and Holger Kirchhoff and Peter Grosche and Xavier Serra},
journal= {arXiv preprint arXiv:2312.09207},
year = {2024}
}
备注
Submitted to 30th International Conference on MultiMedia Modeling (MMM2024). This preprint has not undergone peer review or any post-submission improvements or corrections