中文

面向弱监督小足迹音频事件检测的多示例深度学习

声音 2018-03-28 v2 音频与语音处理

摘要

最先进的音频事件检测(AED)系统依赖于使用强标注数据进行监督学习。然而,这种依赖严重限制了向大规模数据集的可扩展性,因为精细标注过于昂贵而难以获取。在本文中,我们提出了一种使用弱标注标签进行多类AED的小足迹多示例学习(MIL)框架。所提出的MIL框架使用从预训练卷积神经网络提取的音频嵌入作为输入特征。我们表明,通过使用音频嵌入,MIL框架可以用简单的DNN实现,性能可与循环神经网络相媲美。我们通过使用AudioSet(一个大型弱标注YouTube视频片段集合)的子集训练音频标注系统来评估我们的方法。结合后期融合方法,我们将基线音频标注系统的F1分数提高了17%。我们表明,卷积神经网络提取的音频嵌入显著提升了所有MIL模型的性能。该框架降低了AED系统的模型复杂度,适用于计算资源有限的应用场景。

关键词

引用

@article{arxiv.1712.09673,
  title  = {Multiple Instance Deep Learning for Weakly Supervised Small-Footprint Audio Event Detection},
  author = {Shao-Yen Tseng and Juncheng Li and Yun Wang and Joseph Szurley and Florian Metze and Samarjit Das},
  journal= {arXiv preprint arXiv:1712.09673},
  year   = {2018}
}

备注

5 pages, 3 figures