中文

用于弱标注半监督声音事件检测的前向后向卷积循环神经网络与标签条件卷积神经网络

音频与语音处理 2021-03-12 v1 声音

摘要

本文介绍了我们为DCASE 2020挑战赛任务4(家庭环境中的声音事件检测与分离)所构建的系统。我们提出两种新模型:前向后向卷积循环神经网络(FBCRNN)与标签条件卷积神经网络(CNN)。FBCRNN采用两个循环神经网络(RNN)分类器共享同一CNN进行预处理。一个RNN按正向处理录音,另一个按反向处理,在联合处理完整录音的条件下,两个网络被训练为在录音的每个时间步联合预测音频标签(即弱标签)。所提出的训练方式促使分类器尽早标注事件。因此训练后,网络可应用于较短的音频片段(如200毫秒),从而实现声音事件检测(SED)。此外,我们提出标签条件CNN以补充SED,该网络在训练时使用(预测的)标签即弱标签作为额外输入来预测强标签,其训练所用的伪强标签来自FBCRNN集成。所呈系统分别在系统排名与团队排名中位列第四与第三。后续改进使我们的系统在验证集上基于事件的F1-score平均分别超越挑战赛基线及冠军系统18.0%和2.2%。源代码公开于https://github.com/fgnt/pb_sed。

关键词

引用

@article{arxiv.2103.06581,
  title  = {Forward-Backward Convolutional Recurrent Neural Networks and Tag-Conditioned Convolutional Neural Networks for Weakly Labeled Semi-supervised Sound Event Detection},
  author = {Janek Ebbers and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2103.06581},
  year   = {2021}
}

备注

accepted by dcase2020 workshop, the presented system received the reproducible system award for the dcase2020 challenge task 4