中文

利用带伪强标签的卷积马卡龙网络检测声音事件

音频与语音处理 2021-08-03 v2 声音

摘要

在本文中,我们提出通过使用卷积非负矩阵分解近似得到的伪强标签数据来解决强标签数据缺乏的问题。利用该数据集,我们以半监督方式训练一种称为卷积马卡龙网络(Convolutional Macaron Net, CMN)的新架构,该架构将卷积神经网络(CNN)与MN相结合。我们没有仅训练单一模型或使用Mean-teacher方法,而是使用课程一致性代价和课程插值一致性代价同步训练两个不同的CMN。在推理阶段,其中一个模型提供帧级预测,另一个模型提供片段级预测。基于我们提出的框架,我们的系统在音频场景与事件检测及分类(DCASE)2020挑战赛任务4的基线系统上超出10%以上的优势。与DCASE 2019挑战赛的顶尖提交相比,我们的系统准确率也高出1.8%。另一方面,与DCASE 2020的顶尖提交相比,即使使用了更少的Transformer编码层,我们的准确率也略微高出0.3%。我们的系统在未见过的YouTube评估数据集上保持鲁棒,并相对于DCASE 2019的顶尖提交和基线系统分别有0.6%和6.3%的胜出优势。

关键词

引用

@article{arxiv.2009.09632,
  title  = {Detecting Sound Events Using Convolutional Macaron Net With Pseudo Strong Labels},
  author = {Teck Kai Chan and Cheng Siong Chin},
  journal= {arXiv preprint arXiv:2009.09632},
  year   = {2021}
}

备注

Updated