中文

Mamba-SEUNet:用于单声道语音增强的 Mamba UNet

声音 2025-01-03 v2 人工智能 音频与语音处理

摘要

在最近的语音增强 (SE) 研究中,transformer 及其变体已成为主要方法。然而,自注意力机制的二次复杂度对实际部署造成了一定限制。Mamba 作为一种新型状态空间模型 (SSM),因其在建模长序列方面的强大能力以及相对较低的计算复杂度,在自然语言处理和计算机视觉领域获得了广泛应用。在本工作中,我们引入了 Mamba-SEUNet,这是一个将 Mamba 与 UNet 集成用于 SE 任务的创新架构。通过利用 Mamba 在不同分辨率上建模语音信号的前向和后向依赖,并 incorporating skip 连接来捕获多尺度信息,我们的方法实现了最先进 (SOTA) 的性能。在 VCTK+DEMAND 数据集上的实验结果表明,Mamba-SEUNet 获得了 3.59 的 PESQ 分数,同时保持低的计算复杂度。当结合感知对比拉伸技术时,Mamba-SEUNet 进一步将 PESQ 分数提高到 3.73。

关键词

引用

@article{arxiv.2412.16626,
  title  = {Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement},
  author = {Junyu Wang and Zizhen Lin and Tianrui Wang and Meng Ge and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2412.16626},
  year   = {2025}
}

备注

Accepted at ICASSP 2025, 5 pages, 1 figures, 5 tables