面向弱标记数据声音事件检测的联合分离—分类模型
声音
2019-12-10 v2 音频与语音处理
摘要
源分离(SS)旨在从音频录音中分离出各个声源。声音事件检测(SED)旨在从音频录音中检测声音事件。我们提出一种仅用弱标记音频数据训练的联合分离—分类(JSC)模型,即仅知音频录音的标签而不知事件发生的时刻。首先,我们提出从音频的时频(T-F)表示到音频事件的 T-F 分割掩码的分离映射。其次,从每个 T-F 分割掩码构建到各音频事件存在概率的分类映射。在源分离阶段,可从 T-F 分割掩码获得音频事件声源及声音事件时刻。所提方法在 SED 中取得 0.14 的等错误率(EER),优于 0.29 的深度神经网络基线。采用全局加权排序池化(GWRP)作为概率映射获得 8.08 dB 的源分离 SDR,优于基于全局最大池化(GMP)的概率映射所得的 0.03 dB SDR。我们的源代码已发布。
引用
@article{arxiv.1711.03037,
title = {A joint separation-classification model for sound event detection of weakly labelled data},
author = {Qiuqiang Kong and Yong Xu and Wenwu Wang and Mark D. Plumbley},
journal= {arXiv preprint arXiv:1711.03037},
year = {2019}
}
备注
Accepted by ICASSP 2018