中文

基于文本监督的音乐序列表示学习

声音 2023-06-01 v1 机器学习 音频与语音处理

摘要

音乐表示学习因其数值信号序列中包含复杂的人类相关概念而 notoriously 困难。为从带标签音频中挖掘更好的音乐序列表示(MUsic SEquence Representation),我们提出一种新颖的文本监督预训练方法,即 MUSER。MUSER 采用音频-频谱-文本三模态对比学习框架,其中借助文本模板文本输入可为任意形式的元数据,而频谱由音频序列导出。我们的实验表明,与当前数据饥渴的预训练方法相比,MUSER 能更灵活地适配下游任务,且仅需 0.056% 的预训练数据即可达到最先进的性能。

关键词

引用

@article{arxiv.2305.19602,
  title  = {Learning Music Sequence Representation from Text Supervision},
  author = {Tianyu Chen and Yuan Xie and Shuai Zhang and Shaohan Huang and Haoyi Zhou and Jianxin Li},
  journal= {arXiv preprint arXiv:2305.19602},
  year   = {2023}
}