中文

基于感受野正则化技术的深度卷积神经网络音频分类与标注

声音 2021-05-27 v1 机器学习 神经与进化计算 音频与语音处理

摘要

本文中,我们研究了多种知名卷积神经网络(CNN)架构变体在不同音频任务上的性能。我们表明,调节 CNN 的感受野(RF)对其泛化能力至关重要。不足的 RF 限制了 CNN 拟合训练数据的能力。相反,具有过大 RF 的 CNN 倾向于过拟合训练数据,且无法泛化到未见的测试数据。由于最先进的 CNN 架构——在计算机视觉及其他领域中——倾向于在层数上更深,其 RF 尺寸随之增大,因此在若干音频分类与标注任务中性能下降。我们研究知名 CNN 架构及其构建模块如何影响感受野。我们提出若干系统性方法来控制 CNN 的 RF,并在不同音频分类与标注任务及数据集上系统性测试所得架构。实验表明,使用我们提出的方法对 CNN 的 RF 进行正则化可大幅改善模型的泛化能力,在较大数据集上优于复杂架构与预训练模型。所提出的 CNN 在多项任务中取得最先进结果,从声学场景分类到音乐中的情感与主题检测再到乐器识别,正如在若干相关挑战赛(DCASE、MediaEval)中的顶尖排名所证明。

关键词

引用

@article{arxiv.2105.12395,
  title  = {Receptive Field Regularization Techniques for Audio Classification and Tagging with Deep Convolutional Neural Networks},
  author = {Khaled Koutini and Hamid Eghbal-zadeh and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2105.12395},
  year   = {2021}
}

备注

Accepted in IEEE/ACM Transactions on Audio, Speech, and Language Processing. Code available: https://github.com/kkoutini/cpjku_dcase20