中文

利用BiMamba和预训练PSELDnet提高立体声事件检测性能

音频与语音处理 2025-07-15 v1 声音

摘要

预训练方法显著提高了声音事件定位与检测(SELD)的性能,但现有基于Transformer的模型仍面临高计算成本问题。为解决此问题,本文提出一种基于预训练PSELDnet和双向Mamba序列模型的立体声SELD系统。具体而言,我们将Conformer模块替换为BiMamba模块。我们还采用非对称卷积更好地捕获音频信号中的时频关系。在DCASE2025 Task 3开发数据集上的测试结果表明,我们的方法优于基线模型和使用Conformer解码器的原始PSELDnet。此外,提出的方法所需的计算资源少于基线模型。这些结果表明,BiMamba架构对于解决SELD任务中的关键挑战有效且高效。源代码已公开访问,地址为https://github.com/alexandergwm/DCASE2025 TASK3 Stereo PSELD Mamba。

关键词

引用

@article{arxiv.2507.09570,
  title  = {Enhancing Stereo Sound Event Detection with BiMamba and Pretrained PSELDnet},
  author = {Wenmiao Gao and Han Yin},
  journal= {arXiv preprint arXiv:2507.09570},
  year   = {2025}
}