中文

面向声音事件定位与检测的动态核卷积网络及场景专用训练

音频与语音处理 2023-07-18 v1

摘要

基于DNN的方法在声音事件定位与检测(SELD)中展现出高性能。而在真实空间声场中,混响及各种声音事件出现的不平衡增加了SELD任务的复杂性。本文提出一种在真实空间场景中有效的SELD系统。方法中,在卷积块后引入动态核卷积模块,以不同感受野自适应建模通道维特征。其次,我们将SELDnet与EINv2框架结合多轨ACCDOA融入所提SELD系统。此外,训练阶段引入两种场景专用策略以提升系统在真实空间声场中的泛化性。最后,我们应用数据增强方法通过通道旋转、空间数据合成扩展数据集。采用四项联合指标在Sony-TAu Realistic Spatial Soundscapes 2022数据集上评估SELD系统性能。实验结果表明所提系统优于固定核卷积SELD系统。并且,所提系统在DCASE SELD任务中取得0.348的SELD分数,超越SOTA方法。

关键词

引用

@article{arxiv.2307.08239,
  title  = {Dynamic Kernel Convolution Network with Scene-dedicate Training for Sound Event Localization and Detection},
  author = {Siwei Huang and Jianfeng Chen and Jisheng Bai and Yafei Jia and Dongzhe Zhang},
  journal= {arXiv preprint arXiv:2307.08239},
  year   = {2023}
}

备注

11 pages, 6 figures