中文

用于半监督声音事件检测的幂池化算子与置信度学习

声音 2020-05-26 v1 音频与语音处理

摘要

近年来,合成强标签数据、弱标签数据和无标签数据的结合在半监督声音事件检测(SSED)中引起了广泛的研究关注。自训练模型在没有强标注的情况下进行预测,然后将高概率的预测作为伪标签用于重新训练。这类模型已在 SSED 中展现出有效性。然而,概率是校准不佳的置信度估计,低概率样本被忽略。因此,我们引入了一种审慎学习置信度的方法,并通过将置信度作为权重来明确保留所有数据。此外,线性池化被认为是弱标签 SSED 中最先进的聚合函数。在本文中,我们提出了一种幂池化函数,其系数可自动训练以实现非线性。设计了一个基于置信度的半监督声音事件检测(C-SSED)框架,以结合置信度和幂池化。实验结果表明,置信度与预测的准确度成正比。幂池化函数在错误率和 F1 结果上均优于线性池化。此外,与基线模型相比,C-SSED 框架实现了 34% 的相对错误率降低。

关键词

引用

@article{arxiv.2005.11459,
  title  = {Power Pooling Operators and Confidence Learning for Semi-Supervised Sound Event Detection},
  author = {Yuzhuo Liu and Hangting Chen and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2005.11459},
  year   = {2020}
}