MusiCoder:基于 Transformer 的通用音乐声学编码器
音频与语音处理
2021-02-02 v2 多媒体
摘要
音乐标注一直是音乐信息检索(MIR)领域的关键课题之一。传统模型使用监督学习完成音乐标注任务。然而,随着监督机器学习方法复杂度的增加,对更多标注训练数据的需求往往无法由可用数据满足。本文提出一种名为 MusiCoder 的新型自监督音乐声学表示学习方法。受 BERT 成功的启发,MusiCoder 构建于自注意力双向 Transformer 架构之上。设计了连续帧掩码(CFM)与连续通道掩码(CCM)两个预训练目标,以将类 BERT 的掩码重建预训练适配到连续声学帧域。MusiCoder 的性能在两个下游音乐标注任务中得到评估。结果表明 MusiCoder 在音乐流派分类与自动标注任务上均优于最先进模型。MusiCoder 的有效性表明了一种理解音乐的自监督学习新路径的巨大潜力:先应用掩码重建任务以海量无标注音乐声学数据预训练基于 Transformer 的模型,再以有标注数据在特定的下游任务上微调该模型。
引用
@article{arxiv.2008.00781,
title = {MusiCoder: A Universal Music-Acoustic Encoder Based on Transformers},
author = {Yilun Zhao and Jia Guo},
journal= {arXiv preprint arXiv:2008.00781},
year = {2021}
}