中文

使用带全局平均池化的 DenseNet 进行音频标注与弱监督声学事件检测的联合框架

音频与语音处理 2020-08-11 v1 声音

摘要

本文提出一种主要设计用于音频标注、也可用于弱监督声学事件检测 (AED) 的网络架构。所提网络由修改后的 DenseNet 作为特征提取器,以及一个全局平均池化 (GAP) 层组成,在推理时预测帧级标签。该架构受 Zhou 等人提出的、使用 GAP 在给定图像级标签下定位视觉对象的著名框架启发。虽然先前大多数弱监督 AED 工作使用带注意力机制的循环层来定位声学事件,所提网络直接使用 DenseNet 提取的特征图定位事件,而不使用任何循环层。在 DCASE 2017 的音频标注任务中,我们的方法在 F1 分数上绝对数值于开发集显著优于最先进 (state-of-the-art) 方法 5.3%,于评测集优于 6.0%。对于 DCASE 2018 的弱监督 AED 任务,我们的模型通过数据增强和三重训练利用无标签数据,在基于事件的 F1 上绝对数值于开发集优于最先进方法 8.1%,于评测集优于 0.5%。

关键词

引用

@article{arxiv.2008.03350,
  title  = {A Joint Framework for Audio Tagging and Weakly Supervised Acoustic Event Detection Using DenseNet with Global Average Pooling},
  author = {Chieh-Chi Kao and Bowen Shi and Ming Sun and Chao Wang},
  journal= {arXiv preprint arXiv:2008.03350},
  year   = {2020}
}

备注

Accepted by Interspeech 2020