中文

TF-Mamba:面向声源定位的时间频率网络

音频与语音处理 2025-05-21 v2 声音

摘要

声源定位(Sound Source Localization, SSL)是指利用多通道音频数据确定声源位置。它常用于提高语音增强与分离效果。从语音信号中提取空间特征对于SSL尤为关键,尤其是在挑战性的声学环境下。最近,一种称为Mamba的新型结构在 various sequence-based modalities 上展现出突出性能。本研究介绍了用于SSL任务的Mamba模型。我们考虑采用基于Mamba的模型来通过融合时域与频域特征来分析语音信号的空间特征,开发了一个名为TF-Mamba的SSL系统。该系统集成了时频融合机制,采用双向Mamba处理时序与频率信息。我们在模拟数据与真实数据上进行了实验。实验结果表明,TF-Mamba显著优于其他先进方法。该代码将在适当时公开发布。

关键词

引用

@article{arxiv.2409.05034,
  title  = {TF-Mamba: A Time-Frequency Network for Sound Source Localization},
  author = {Yang Xiao and Rohan Kumar Das},
  journal= {arXiv preprint arXiv:2409.05034},
  year   = {2025}
}

备注

Accepted by Interspeech 2025