使用压缩激励残差 CNN 的声音事件定位与检测
声音
2021-08-02 v3 音频与语音处理
摘要
声音事件定位与检测(SELD)是一个与机器听觉领域相关的问题,其目标是识别单个声音事件、检测其时间活动并估计其空间位置。得益于更多硬标注音频数据集的出现,深度学习技术已成为最先进的解决方案。最常见的那些是实现了卷积循环网络(CRNN)的方法,其先将音频信号转换为多通道 2D 表示。压缩激励技术可视为一种卷积增强,旨在独立地学习空间与通道特征图,而非像标准卷积那样一起学习。这通常通过组合一些全局聚类算子、线性算子以及块输入与其学习到关系之间的最终校准来实现。本工作旨在通过在 CRNN 的卷积部分添加残差压缩激励(SE)块来改进 DCASE 2020 Task 3 中基线 CRNN 的准确率结果。所遵循的步骤包括对残差 SE 块的比例参数(用于线性关系中)进行网格搜索,而网络的超参数与基线保持一致。实验表明,仅引入残差 SE 块就能使所得结果较基线有显著提升。
引用
@article{arxiv.2006.14436,
title = {Sound Event Localization and Detection using Squeeze-Excitation Residual CNNs},
author = {Javier Naranjo-Alcazar and Sergi Perez-Castanos and Jose Ferrandis and Pedro Zuccarello and Maximo Cobos},
journal= {arXiv preprint arXiv:2006.14436},
year = {2021}
}
备注
Accepted in URSI 2021, Vigo, Spain