MuSLCAT:用于原始波形上判别性音乐建模的多尺度多级卷积注意力Transformer
声音
2021-04-07 v1 机器学习
音频与语音处理
摘要
本工作中,我们旨在通过在一个高效的端到端架构中同时建模序列(时间)与层次信息,来提升基于波形的判别性音乐网络的表达能力。我们提出MuSLCAT,即多尺度多级卷积注意力Transformer,一种直接从原始波形录音学习复杂音乐标签鲁棒表示的新型架构。我们还引入了MuSLCAT的轻量变体MuSLCAN,意为多尺度多级卷积注意力网络。MuSLCAT与MuSLCAN均通过集成前端-后端架构来从多尺度与多级建模特征。前端针对不同的频率范围,同时使用两个带注意力增强卷积(AAC)块的卷积注意力网络来建模长程依赖与多级交互。后端通过引入自注意力动态重标定从前端提取的多尺度与多级特征。MuSLCAT与MuSLCAN的区别在于其后端组件:MuSLCAT的后端是BERT的修改版,而MuSLCAN的则是一个简单AAC块。我们在四个用于音乐标签与流派识别的基准数据集上将提出的MuSLCAT与MuSLCAN架构与SOTA网络比较以作验证。实验表明,与SOTA基于波形的模型相比,MuSLCAT与MuSLCAN始终取得具竞争力的结果,却所需参数明显更少。
引用
@article{arxiv.2104.02309,
title = {MuSLCAT: Multi-Scale Multi-Level Convolutional Attention Transformer for Discriminative Music Modeling on Raw Waveforms},
author = {Kai Middlebrook and Shyam Sudhakaran and David Guy Brizan},
journal= {arXiv preprint arXiv:2104.02309},
year = {2021}
}