基于压缩-激励残差网络的声学场景分类
声音
2020-06-29 v3 机器学习
音频与语音处理
摘要
声学场景分类(ASC)是机器听觉领域的一个问题,其目标是将音频片段分类/标注为描述场景位置(如公园、机场等)的预定义标签。许多ASC的先进解决方案结合了数据增强技术与模型集成。然而,仅通过修改卷积神经网络(CNN)的架构也可获得显著改进。本工作中我们提出两种新颖的压缩-激励块,以基于残差学习提升CNN架构的ASC框架准确率。压缩-激励块的主要思想是独立地学习空间与通道特征图,而非像标准CNN那样联合学习。这通常通过一些全局分组算子、线性算子以及输入与所获关系间的最终校准来实现。实现这些算子的块的行为以及因此整个神经网络,可根据块输入、所设残差配置与所选非线性激活而改变。分析使用2019年DCASE挑战赛发布的TAU Urban Acoustic Scenes 2019数据集(https://zenodo.org/record/2589280)进行。本文讨论的所有配置均超越DCASE组织提出的基线13个百分点。相应地,本文提出的新颖配置优于先前工作中提出的残差配置。
引用
@article{arxiv.2003.09284,
title = {Acoustic Scene Classification with Squeeze-Excitation Residual Networks},
author = {Javier Naranjo-Alcazar and Sergi Perez-Castanos and Pedro Zuccarello and Maximo Cobos},
journal= {arXiv preprint arXiv:2003.09284},
year = {2020}
}