中文

单声道语音增强的选择性状态空间模型

音频与语音处理 2024-11-12 v1

摘要

语音用户界面(VUI)通过语音命令促进了人与机器之间的高效交互。由于真实世界的声学场景复杂,语音增强对于鲁棒的VUI至关重要。Transformer及其变体(如Conformer)在语音增强中展示了最先进的结果。然而,两者都存在关于序列长度的二次计算复杂度,这限制了它们处理长序列的能力。最近,一种名为Mamba的新型状态空间模型展现出以线性复杂度处理长序列的强大能力,为解决这一挑战提供了方案。在本文中,我们提出了一种新颖的混合卷积-Mamba骨干网络,记为MambaDC,用于语音增强。我们的MambaDC结合了卷积网络建模局部交互的优势和Mamba建模长程全局依赖的能力。我们在两个常用训练目标上,在基础和最先进(SoTA)语音增强框架中进行了全面的实验。结果表明MambaDC在所有训练目标上均优于Transformer、Conformer和标准Mamba。基于当前先进框架,使用MambaDC骨干网络展示了优于现有SoTA系统的结果。这为语音增强中的高效长程全局建模奠定了基础。

关键词

引用

@article{arxiv.2411.06217,
  title  = {Selective State Space Model for Monaural Speech Enhancement},
  author = {Moran Chen and Qiquan Zhang and Mingjiang Wang and Xiangyu Zhang and Hexin Liu and Eliathamby Ambikairaiah and Deying Chen},
  journal= {arXiv preprint arXiv:2411.06217},
  year   = {2024}
}

备注

Submitted to IEEE TCE