中文

用于声音事件检测的半监督NMF-CNN

音频与语音处理 2020-09-22 v2 声音

摘要

本文提出一种结合非负矩阵分解(NMF)与卷积神经网络(CNN)的方法,用于音频片段声音事件检测(SED)。主要思路首先利用NMF为弱标记数据近似强标记;随后使用近似得到的强标记数据,在半监督框架下训练两个不同的CNN,其中一个用于片段级预测,另一个用于帧级预测。基于该思路,我们的模型在声学场景与事件检测及分类(DCASE) 2020挑战赛任务4验证集上取得了基于事件的F1-score为45.7%。通过对后验输出取平均集成模型,基于事件的F1-score可提升至48.6%。与基线模型相比,我们所提模型超出基线模型8%以上。在DCASE 2020挑战赛任务4测试集上测试,我们的模型可取得基于事件的F1-score为44.4%,而集成系统可取得46.3%。该结果较基线系统至少有7%的优势,表明我们所提方法在不同数据集上的鲁棒性。

关键词

引用

@article{arxiv.2007.00908,
  title  = {Semi-Supervised NMF-CNN For Sound Event Detection},
  author = {Chan Teck Kai and Chin Cheng Siong and Li Ye},
  journal= {arXiv preprint arXiv:2007.00908},
  year   = {2020}
}

备注

5 pages, 2 tables