中文

基于压缩-激励残差网络的声学场景分类

声音 2020-06-29 v3 机器学习 音频与语音处理

摘要

声学场景分类(ASC)是机器听觉领域的一个问题,其目标是将音频片段分类/标注为描述场景位置(如公园、机场等)的预定义标签。许多ASC的先进解决方案结合了数据增强技术与模型集成。然而,仅通过修改卷积神经网络(CNN)的架构也可获得显著改进。本工作中我们提出两种新颖的压缩-激励块,以基于残差学习提升CNN架构的ASC框架准确率。压缩-激励块的主要思想是独立地学习空间与通道特征图,而非像标准CNN那样联合学习。这通常通过一些全局分组算子、线性算子以及输入与所获关系间的最终校准来实现。实现这些算子的块的行为以及因此整个神经网络,可根据块输入、所设残差配置与所选非线性激活而改变。分析使用2019年DCASE挑战赛发布的TAU Urban Acoustic Scenes 2019数据集(https://zenodo.org/record/2589280)进行。本文讨论的所有配置均超越DCASE组织提出的基线13个百分点。相应地,本文提出的新颖配置优于先前工作中提出的残差配置。

关键词

引用

@article{arxiv.2003.09284,
  title  = {Acoustic Scene Classification with Squeeze-Excitation Residual Networks},
  author = {Javier Naranjo-Alcazar and Sergi Perez-Castanos and Pedro Zuccarello and Maximo Cobos},
  journal= {arXiv preprint arXiv:2003.09284},
  year   = {2020}
}