中文

一种用于半监督声音事件检测的多粒度注意力网络

声音 2022-11-01 v1 音频与语音处理

摘要

声音事件检测(SED)是一项有趣但具有挑战性的任务,其原因在于真实生活中数据的稀缺性和声音事件的多样性。本文提出一种用于半监督声音事件检测的多粒度注意力网络(MGA-Net)。为获取与声音事件相关的特征表示,设计了一种残差混合卷积(RH-Conv)模块,以增强原始卷积提取时频特征的能力。此外,设计了一种多粒度注意力(MGA)模块,用于从粗粒度到细粒度学习时间分辨率特征。借助 MGA 模块,网络能够捕捉短时长或长时长目标事件的特征,从而更准确地确定声音事件的起止点。进一步地,为有效提升 Mean Teacher(MT)方法的性能,引入了空间偏移(SS)模块作为一种数据扰动机制,以增加数据的多样性。实验结果表明,MGA-Net 优于已发表的最先进竞争对手,在验证集和公开集上分别取得了 53.27% 和 56.96% 的基于事件的宏 F1(EB-F1)分数,以及 0.709 和 0.739 的多音声音检测分数(PSDS)。

关键词

引用

@article{arxiv.2206.10175,
  title  = {A Multi-grained based Attention Network for Semi-supervised Sound Event Detection},
  author = {Ying Hu and Xiujuan Zhu and Yunlong Li and Hao Huang and Liang He},
  journal= {arXiv preprint arXiv:2206.10175},
  year   = {2022}
}