中文

MambAttention:结合 Mamba 与多头注意力的通用单通道语音增强

声音 2026-01-22 v4 人工智能 音频与语音处理

摘要

随着新兴的序列模型如 Mamba 和 xLSTM 的出现,已有研究表明这些模型在单通道语音增强和音频表示学习方面表现出与或优于当前最先进技术。然而,先前的研究表明,像 LSTM 和 Mamba 这样的序列模型容易过拟合到训练数据集。为此,以往工作通过在 LSTM 中添加自注意力机制,显著提升了单通道语音增强的泛化性能。然而,既有的混合 Mamba 和时频注意力模型的概念,以及其在语音增强中的泛化性能,尚未被探索。本文提出一种新型的混合架构——MambAttention,将 Mamba 与共享的时-频多头注意力模块结合,用于通用单通道语音增强。为训练该模型,我们引入 VB-DemandEx 数据集,这一数据集灵感来自 VoiceBank+Demand,但包含更具挑战性的噪声类型和更低的信噪比。在 VB-DemandEx 上训练的 MambAttention 在两个跨域数据集(DNS 2020 无混响及 EARS-WHAM_v2)上,均显著优于基于相近复杂度的现有最先进的判别式 LSTM、xLSTM、Mamba 和 Conformer 系统。MambAttention 也在泛化性能上与生成式扩散模型持平或优于,同时与语言模型基线相当。消融研究突出了时-频多头注意力模块之间权重共享对泛化性能的重要性。最后,我们探索将共享的时-频多头注意力模块与 LSTM 和 xLSTM 集成,结果在跨域数据集上取得显著性能提升。然而,MambAttention 在所有报告的评估指标上仍保持优势,以实现跨语料库的泛化。

关键词

引用

@article{arxiv.2507.00966,
  title  = {MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement},
  author = {Nikolai Lund Kühne and Jesper Jensen and Jan Østergaard and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2507.00966},
  year   = {2026}
}

备注

Accepted to IEEE Transactions on Audio, Speech, and Language Processing