用于声音事件检测的选择性伪标注与类间判别融合
音频与语音处理
2022-03-07 v1 声音
摘要
近年来,探索有效的声音分离(SSep)技术以改善重叠声音事件检测(SED)吸引了越来越多关注。生成准确的分离信号以避免SED模型训练期间的灾难性错误累积非常重要且具有挑战性。在本研究中,我们首先提出一种新颖的选择性伪标注方法,称为SPL,以从盲声音分离输出中产生高置信度的分离目标事件。这些目标事件随后用于以多目标学习风格微调在声音混合上预训练的原有SED模型。然后,为进一步利用SSep输出,提出类间判别融合,通过结合声音混合及其分离信号的多个帧级事件预测来提升最终SED性能。所有实验均在公开DCASE 2021 Task 4数据集上进行,结果表明我们的方法显著优于官方基线,基于collar的F1、PSDS1和PSDS2性能分别从44.3%、37.3%和54.9%提升至46.5%、44.5%和75.4%。
引用
@article{arxiv.2203.02191,
title = {Selective Pseudo-labeling and Class-wise Discriminative Fusion for Sound Event Detection},
author = {Yunhao Liang and Yanhua Long and Yijie Li and Jiaen Liang},
journal= {arXiv preprint arXiv:2203.02191},
year = {2022}
}
备注
This article was submitted to Interspeech 2022