中文

探索混合Mamba-U-Net中基于分辨率的共享注意力以提升跨语料语音增强

声音 2026-01-22 v2 人工智能 音频与语音处理

摘要

近期语音增强研究表明,结合Mamba与注意力机制的模型在跨语料泛化性能上表现优越。同时,将Mamba集成到U-Net结构中已取得最先进的增强性能,同时降低了模型规模和计算复杂度。受这些洞察启发,我们提出RWSA-MambaUNet,一种新颖高效的混合模型,在U-Net结构中结合Mamba与多头注意力以提升跨语料性能。基于分辨率的共享注意力(RWSA)指在对应时间和频率分辨率的层间共享注意力。我们表现最佳的RWSA-MambaUNet模型在两个域外测试集上取得了最先进的泛化性能。值得注意的是,我们最小的模型在域外DNS 2020测试集上以更少的模型参数和计算量,在PESQ、SSNR和ESTOI方面超越了所有基线,在域外EARS-WHAM_v2测试集上在SSNR、ESTOI和SI-SDR方面也超越了所有基线。

关键词

引用

@article{arxiv.2510.01958,
  title  = {Exploring Resolution-Wise Shared Attention in Hybrid Mamba-U-Nets for Improved Cross-Corpus Speech Enhancement},
  author = {Nikolai Lund Kühne and Jesper Jensen and Jan Østergaard and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2510.01958},
  year   = {2026}
}

备注

Accepted to IEEE ICASSP 2026