中文

SELD-Mamba:用于声音事件定位与检测及源距离估计的选择性状态空间模型

声音 2024-08-12 v1 人工智能 音频与语音处理

摘要

在声音事件定位与检测(SELD)任务中,基于Transformer的模型已展现出令人印象深刻的能力。然而,Transformer自注意力机制的二次复杂度导致了计算效率低下。在本文中,我们提出了一种名为SELD-Mamba的SELD网络架构,该架构利用Mamba——一种选择性状态空间模型。我们采用事件独立网络V2(EINV2)作为基础框架,并将其Conformer模块替换为双向Mamba模块,以在保持计算效率的同时捕获更广泛的上下文信息。此外,我们实现了一种两阶段训练方法,第一阶段聚焦于声音事件检测(SED)与到达方向(DoA)估计损失,第二阶段重新引入源距离估计(SDE)损失。我们在2024年DCASE挑战赛Task3数据集上的实验结果证明了选择性状态空间模型在SELD中的有效性,并展示了两阶段训练方法在提升SELD性能方面的优势。

关键词

引用

@article{arxiv.2408.05057,
  title  = {SELD-Mamba: Selective State-Space Model for Sound Event Localization and Detection with Source Distance Estimation},
  author = {Da Mu and Zhicheng Zhang and Haobo Yue and Zehao Wang and Jin Tang and Jianqin Yin},
  journal= {arXiv preprint arXiv:2408.05057},
  year   = {2024}
}