中文

MFF-EINV2:面向声音事件定位与检测的跨频谱-空间-时间域多尺度特征融合

声音 2024-06-18 v2 人工智能 音频与语音处理

摘要

声音事件定位与检测(SELD)涉及使用多通道录音检测和定位声音事件。先前提出的事件独立网络V2(EINV2)在SELD上取得了出色性能。然而,它在有效提取跨频谱、空间和时间域的特征方面仍面临挑战。本文提出了一种名为多尺度特征融合(MFF)模块的三阶段网络结构,以充分提取跨频谱、空间和时间域的多尺度特征。MFF模块利用并行子网络架构生成多尺度频谱和空间特征。采用TF-卷积模块提供多尺度时间特征。我们将MFF融入EINV2,并将所提方法称为MFF-EINV2。在2022年和2023年DCASE挑战赛任务3数据集上的实验结果表明,我们的MFF-EINV2是有效的,与已发表方法相比达到了最先进的性能。

关键词

引用

@article{arxiv.2406.08771,
  title  = {MFF-EINV2: Multi-scale Feature Fusion across Spectral-Spatial-Temporal Domains for Sound Event Localization and Detection},
  author = {Da Mu and Zhicheng Zhang and Haobo Yue},
  journal= {arXiv preprint arXiv:2406.08771},
  year   = {2024}
}

备注

Accepted by Interspeech 2024