基于 PSELDnet 预训练和 BiMamba 序列建模的立体声声事件定位与检测
音频与语音处理
2025-06-17 v1 声音
摘要
预训练方法在声事件定位与检测(SELD)任务中取得了显著的性能提升,但现有的基于 Transformer 的模型 suffer 于高计算复杂度。本文提出一种基于预训练 PSELDnet 和双向 Mamba 序列建模的立体声声事件定位与检测系统。我们将 Conformer 模块替换为 BiMamba 模块,并引入非对称卷积更有效地建模时间与频率维度之间的时空关系。实验结果表明,所提方法在 DCASE2025 Task 3 开发数据集上,相较于基线模型和采用 Conformer 解码器架构的原始 PSELDnet,性能显著提升,同时降低了计算复杂度。这一发现凸显了 BiMamba 架构在解决 SELD 任务挑战方面的有效性。
引用
@article{arxiv.2506.13455,
title = {Stereo sound event localization and detection based on PSELDnet pretraining and BiMamba sequence modeling},
author = {Wenmiao Gao and Yang Xiao},
journal= {arXiv preprint arXiv:2506.13455},
year = {2025}
}
备注
Technical report for DCASE 2025 Challenge Task 3