利用大规模无标签同域数据用于声音事件检测的弱监督CRNN系统
声音
2018-11-02 v1 音频与语音处理
摘要
声音事件检测(SED)通常被视为一种监督学习问题,需要带有声音事件强时间标签的训练数据。然而,制作带有强标签的数据集通常需要难以承受的人力成本。这限制了监督式SED方法的实际应用。近期SED方法的进展集中于利用弱标签或无标签训练数据来检测声音事件。本文提出一种联合框架,利用大规模无标签同域数据解决SED任务。具体而言,首先采用最先进的通用音频标注模型为无标签数据预测弱标签。另一方面,开发了一种基于卷积循环神经网络(CRNN)的弱监督架构,借助带有预测标签的无标签数据来求解声音事件的强标注。研究发现,随着更多无标签数据加入训练,SED性能总体提升。为解决无标签数据的噪声标签问题,采用集成策略以增强系统鲁棒性。所提系统在DCASE 2018挑战赛的SED数据集上进行了评估,其F1-score达到21.0%,相较基线系统提升了10%。
引用
@article{arxiv.1811.00301,
title = {Weakly supervised CRNN system for sound event detection with large-scale unlabeled in-domain data},
author = {Dezhi Wang and Lilun Zhang and Changchun Bao and Kele Xu and Boqing Zhu and Qiuqiang Kong},
journal= {arXiv preprint arXiv:1811.00301},
year = {2018}
}
备注
Submitted to ICASSP 2019