中文

用于声学场景分类的感受野正则化CNN变体

音频与语音处理 2019-09-09 v1 机器学习 声音 机器学习

摘要

声学场景分类及相关任务一直由卷积神经网络(CNNs)主导。性能最优的CNN主要使用音频频谱图作为输入,其架构设计主要借鉴计算机视觉。近期一项研究表明,以适当方式限制CNN的感受野(RF)对其在音频任务中的性能、鲁棒性和泛化能力至关重要。限制CNN感受野的一个副作用是更多频率信息会丢失。本文中,我们首先在DCASE 2019 Task 1.A数据集上,对各种CNN架构的不同RF配置进行了系统性研究。其次,我们引入了频率感知CNN,以补偿因受限RF导致的频率信息缺失,并通过实验确定它们在哪些RF范围内能带来额外提升。这些研究的结果是向DCASE 2019挑战赛不同任务提交的若干性能优异的方案。

关键词

引用

@article{arxiv.1909.02859,
  title  = {Receptive-field-regularized CNN variants for acoustic scene classification},
  author = {Khaled Koutini and Hamid Eghbal-zadeh and Gerhard Widmer},
  journal= {arXiv preprint arXiv:1909.02859},
  year   = {2019}
}

备注

Accepted at Detection and Classification of Acoustic Scenes and Events 2019 (DCASE Workshop 2019)