用于声音事件检测的半监督NMF-CNN
音频与语音处理
2020-09-22 v2 声音
摘要
本文提出一种结合非负矩阵分解(NMF)与卷积神经网络(CNN)的方法,用于音频片段声音事件检测(SED)。主要思路首先利用NMF为弱标记数据近似强标记;随后使用近似得到的强标记数据,在半监督框架下训练两个不同的CNN,其中一个用于片段级预测,另一个用于帧级预测。基于该思路,我们的模型在声学场景与事件检测及分类(DCASE) 2020挑战赛任务4验证集上取得了基于事件的F1-score为45.7%。通过对后验输出取平均集成模型,基于事件的F1-score可提升至48.6%。与基线模型相比,我们所提模型超出基线模型8%以上。在DCASE 2020挑战赛任务4测试集上测试,我们的模型可取得基于事件的F1-score为44.4%,而集成系统可取得46.3%。该结果较基线系统至少有7%的优势,表明我们所提方法在不同数据集上的鲁棒性。
引用
@article{arxiv.2007.00908,
title = {Semi-Supervised NMF-CNN For Sound Event Detection},
author = {Chan Teck Kai and Chin Cheng Siong and Li Ye},
journal= {arXiv preprint arXiv:2007.00908},
year = {2020}
}
备注
5 pages, 2 tables