中文

SPMamba: 状态空间模型是语音分离所需的一切

声音 2024-09-11 v2 人工智能 音频与语音处理

摘要

现有基于CNN的语音分离模型面临局部感受野限制,无法有效捕获长时间依赖。尽管基于LSTM和Transformer的模型可以避免此问题,但其高复杂度使得在处理长音频时面临计算资源和推理效率的挑战。为解决这一挑战,我们提出了一种创新的语音分离方法SPMamba。该模型基于稳健的TF-GridNet架构,用双向Mamba模块替换传统的BLSTM模块。这些模块有效建模时间和频率维度之间的时空关系,使SPMamba能够以线性计算复杂度捕获长程依赖。具体而言,Mamba模块内的双向处理使模型能够利用过去和未来的上下文信息,从而提升分离性能。在公开数据集(包括WSJ0-2Mix、WHAM!、Libri2Mix以及新构建的Echo2Mix)上进行的大量实验表明,SPMamba显著优于现有最先进模型,在降低计算复杂度的同时取得了更优结果。这些发现凸显了SPMamba在复杂环境中应对语音分离复杂挑战的有效性。

关键词

引用

@article{arxiv.2404.02063,
  title  = {SPMamba: State-space model is all you need in speech separation},
  author = {Kai Li and Guo Chen and Runxuan Yang and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2404.02063},
  year   = {2024}
}

备注

Technical Report. Code is available at https://github.com/JusperLee/SPMamba