TF-Mamba:面向声源定位的时间频率网络
音频与语音处理
2025-05-21 v2 声音
摘要
声源定位(Sound Source Localization, SSL)是指利用多通道音频数据确定声源位置。它常用于提高语音增强与分离效果。从语音信号中提取空间特征对于SSL尤为关键,尤其是在挑战性的声学环境下。最近,一种称为Mamba的新型结构在 various sequence-based modalities 上展现出突出性能。本研究介绍了用于SSL任务的Mamba模型。我们考虑采用基于Mamba的模型来通过融合时域与频域特征来分析语音信号的空间特征,开发了一个名为TF-Mamba的SSL系统。该系统集成了时频融合机制,采用双向Mamba处理时序与频率信息。我们在模拟数据与真实数据上进行了实验。实验结果表明,TF-Mamba显著优于其他先进方法。该代码将在适当时公开发布。
引用
@article{arxiv.2409.05034,
title = {TF-Mamba: A Time-Frequency Network for Sound Source Localization},
author = {Yang Xiao and Rohan Kumar Das},
journal= {arXiv preprint arXiv:2409.05034},
year = {2025}
}
备注
Accepted by Interspeech 2025