用于音乐分类与标注的接受野正则化 CNN
音频与语音处理
2020-07-28 v1 机器学习
声音
摘要
卷积神经网络(CNNs)已成功应用于各类音乐信息检索(MIR)任务,既作为端到端模型,也作为更复杂系统的特征提取器。然而,MIR 领域仍由基于经典 VGG 的 CNN 架构变体主导,常结合注意力等更复杂模块及/或大规模数据集预训练等技术。诸如 ResNet 等更深模型——在其他领域大幅超越 VGG——在 MIR 中很少使用。正如我们将展示的,其主要原因之一是更深 CNN 在音乐域中缺乏泛化能力。在本文中,我们提出一种基于精心设计正则化策略的原则性方法,使 ResNet 等深度架构在音乐相关任务中具有竞争力。具体而言,我们分析了近期引入的接受野正则化(Receptive-Field Regularization)与 Shake-Shake,并表明它们显著改善了深度 CNN 在音乐相关任务上的泛化能力,且所得深度 CNN 可超越当前更复杂的模型(如结合预训练与注意力的 CNN)。我们在两个不同的 MIR 任务及两个相应数据集上证明了这一点,从而将我们的深度正则化 CNN 作为这些数据集的新基线,也可在未来更复杂方法中用作特征提取模块。
引用
@article{arxiv.2007.13503,
title = {Receptive-Field Regularized CNNs for Music Classification and Tagging},
author = {Khaled Koutini and Hamid Eghbal-Zadeh and Verena Haunschmid and Paul Primus and Shreyan Chowdhury and Gerhard Widmer},
journal= {arXiv preprint arXiv:2007.13503},
year = {2020}
}