作为深度卷积神经网络正则化器的感受野在声学场景分类中的应用
机器学习
2019-07-04 v1 声音
音频与语音处理
机器学习
摘要
卷积神经网络(CNNs)在许多机器视觉以及机器听觉任务中取得了巨大成功。因此,许多图像识别网络架构被改编用于音频处理任务。然而,尽管取得了一些成功,其中许多模型在图像域的性能并未迁移到音频域。例如,在图像识别中显著优于 VGG 的极深架构(如 ResNet 和 DenseNet)在声学场景分类(ASC)等音频处理任务中表现并不更佳。本文中,我们探究了此类强大架构在 ASC 中相较简单模型(如 VGG)表现更差的原因。为此,我们分析了这些 CNN 的感受野(RF),并论证了 RF 对模型泛化能力的重要性。利用我们的感受野分析,我们对 ResNet 和 DenseNet 进行了适配,取得了最先进的性能,并最终超越了基于 VGG 的模型。我们提出了在 CNN 中适配 RF 的系统方法,并给出了在三个数据集上的结果,展示了在时间和频率维度上改变 RF 如何影响模型性能。我们的实验结果表明,过小或过大的 RF 均会导致性能下降,但通过在一定范围内谨慎选择合适的 RF 尺寸,可使深度模型具备良好的泛化能力。
引用
@article{arxiv.1907.01803,
title = {The Receptive Field as a Regularizer in Deep Convolutional Neural Networks for Acoustic Scene Classification},
author = {Khaled Koutini and Hamid Eghbal-zadeh and Matthias Dorfer and Gerhard Widmer},
journal= {arXiv preprint arXiv:1907.01803},
year = {2019}
}
备注
IEEE EUSIPCO 2019