基于文本监督的音乐序列表示学习
声音
2023-06-01 v1 机器学习
音频与语音处理
摘要
音乐表示学习因其数值信号序列中包含复杂的人类相关概念而 notoriously 困难。为从带标签音频中挖掘更好的音乐序列表示(MUsic SEquence Representation),我们提出一种新颖的文本监督预训练方法,即 MUSER。MUSER 采用音频-频谱-文本三模态对比学习框架,其中借助文本模板文本输入可为任意形式的元数据,而频谱由音频序列导出。我们的实验表明,与当前数据饥渴的预训练方法相比,MUSER 能更灵活地适配下游任务,且仅需 0.056% 的预训练数据即可达到最先进的性能。
引用
@article{arxiv.2305.19602,
title = {Learning Music Sequence Representation from Text Supervision},
author = {Tianyu Chen and Yuan Xie and Shuai Zhang and Shaohan Huang and Haoyi Zhou and Jianxin Li},
journal= {arXiv preprint arXiv:2305.19602},
year = {2023}
}