中文

双路径 Mamba:用于语音分离的短长期双向选择性结构化状态空间模型

音频与语音处理 2024-05-02 v2 声音

摘要

Transformer 一直是各种语音建模任务(包括语音分离)中最成功的架构。然而,Transformer 中具有二次复杂度的自注意力机制在计算和内存方面效率低下。最近的模型在 Transformer 中引入了新的层和模块以获得更好的性能,但也增加了额外的模型复杂度。在本研究中,我们用 Mamba(一种选择性状态空间模型)替代 Transformer 来进行语音分离。我们提出了双路径 Mamba,它利用选择性状态空间对语音信号的短期和长期前向与后向依赖关系进行建模。我们在 WSJ0-2mix 数据上的实验结果表明,我们尺寸相当较小的双路径 Mamba 模型优于 SOTA 的 RNN 模型 DPRNN、CNN 模型 WaveSplit 以及 Transformer 模型 Sepformer。代码:https://github.com/xi-j/Mamba-TasNet

关键词

引用

@article{arxiv.2403.18257,
  title  = {Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation},
  author = {Xilin Jiang and Cong Han and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2403.18257},
  year   = {2024}
}

备注

work in progress