使用带全局平均池化的 DenseNet 进行音频标注与弱监督声学事件检测的联合框架
音频与语音处理
2020-08-11 v1 声音
摘要
本文提出一种主要设计用于音频标注、也可用于弱监督声学事件检测 (AED) 的网络架构。所提网络由修改后的 DenseNet 作为特征提取器,以及一个全局平均池化 (GAP) 层组成,在推理时预测帧级标签。该架构受 Zhou 等人提出的、使用 GAP 在给定图像级标签下定位视觉对象的著名框架启发。虽然先前大多数弱监督 AED 工作使用带注意力机制的循环层来定位声学事件,所提网络直接使用 DenseNet 提取的特征图定位事件,而不使用任何循环层。在 DCASE 2017 的音频标注任务中,我们的方法在 F1 分数上绝对数值于开发集显著优于最先进 (state-of-the-art) 方法 5.3%,于评测集优于 6.0%。对于 DCASE 2018 的弱监督 AED 任务,我们的模型通过数据增强和三重训练利用无标签数据,在基于事件的 F1 上绝对数值于开发集优于最先进方法 8.1%,于评测集优于 0.5%。
引用
@article{arxiv.2008.03350,
title = {A Joint Framework for Audio Tagging and Weakly Supervised Acoustic Event Detection Using DenseNet with Global Average Pooling},
author = {Chieh-Chi Kao and Bowen Shi and Ming Sun and Chao Wang},
journal= {arXiv preprint arXiv:2008.03350},
year = {2020}
}
备注
Accepted by Interspeech 2020