中文

面向噪声和回声环境的 U-Mamba-Net:高效 Mamba 架构 U-Net 语音分离模型

声音 2024-12-25 v1 机器学习 音频与语音处理

摘要

语音分离涉及将混合语音(包含多个重叠说话人)分离为多个语音流,每个语音流仅包含一个说话人的语音。许多高效模型不断涌现并快速扩散。然而,这些模型的规模和计算负荷也随之增加。这对研究社区来说是一大灾难,因为研究者需要更多的时间和计算资源来复现和比较现有模型。本文提出一种用于复杂环境语音分离的轻量级 Mamba 架构 U-Net 模型 U-Mamba-Net。Mamba 是一种状态空间序列模型,具备特征选择能力。U-Net 是一种全卷积神经网络,其对称收缩和扩张路径能够学习多分辨率特征。在我们的工作中,Mamba 作为特征过滤器,交替使用于 U-Net。我们在 Libri2mix 上测试了所提模型。结果表明,U-Mamba-Net 在计算成本较低的情况下实现了 improved performance。

关键词

引用

@article{arxiv.2412.18217,
  title  = {U-Mamba-Net: A highly efficient Mamba-based U-net style network for noisy and reverberant speech separation},
  author = {Shaoxiang Dang and Tetsuya Matsumoto and Yoshinori Takeuchi and Hiroaki Kudo},
  journal= {arXiv preprint arXiv:2412.18217},
  year   = {2024}
}