用于声学场景分类的感受野正则化CNN变体
音频与语音处理
2019-09-09 v1 机器学习
声音
机器学习
摘要
声学场景分类及相关任务一直由卷积神经网络(CNNs)主导。性能最优的CNN主要使用音频频谱图作为输入,其架构设计主要借鉴计算机视觉。近期一项研究表明,以适当方式限制CNN的感受野(RF)对其在音频任务中的性能、鲁棒性和泛化能力至关重要。限制CNN感受野的一个副作用是更多频率信息会丢失。本文中,我们首先在DCASE 2019 Task 1.A数据集上,对各种CNN架构的不同RF配置进行了系统性研究。其次,我们引入了频率感知CNN,以补偿因受限RF导致的频率信息缺失,并通过实验确定它们在哪些RF范围内能带来额外提升。这些研究的结果是向DCASE 2019挑战赛不同任务提交的若干性能优异的方案。
引用
@article{arxiv.1909.02859,
title = {Receptive-field-regularized CNN variants for acoustic scene classification},
author = {Khaled Koutini and Hamid Eghbal-zadeh and Gerhard Widmer},
journal= {arXiv preprint arXiv:1909.02859},
year = {2019}
}
备注
Accepted at Detection and Classification of Acoustic Scenes and Events 2019 (DCASE Workshop 2019)