用于声音事件检测的多维频率动态卷积与置信均值教师
音频与语音处理
2023-02-22 v2 声音
摘要
近年来,卷积神经网络(CNN)已广泛应用于声音事件检测(SED)。然而,传统卷积在学习不同声音事件的时频域表示方面存在不足。为了解决这个问题,我们提出了多维频率动态卷积(MFDConv),这是一种新的设计,它赋予卷积核沿多个维度的频率自适应动态特性。MFDConv 利用一种新颖的多维注意力机制和并行策略来学习互补的频率自适应注意力,从而显著增强了卷积核的特征提取能力。此外,为了提升均值教师(mean teacher)的性能,我们提出了置信均值教师,以提高教师模型生成的伪标签的准确性,并使用高置信度标签训练学生模型。实验结果表明,所提出的方法在 DESED 真实验证数据集上分别达到了 0.470 和 0.692 的 PSDS1 和 PSDS2 分数。
引用
@article{arxiv.2302.09256,
title = {Multi-dimensional frequency dynamic convolution with confident mean teacher for sound event detection},
author = {Shengchang Xiao and Xueshuai Zhang and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2302.09256},
year = {2023}
}
备注
accepted to ICASSP 2023