利用MAMBA联合频谱与空间学习进行多通道语音增强
音频与语音处理
2025-01-15 v2 声音
摘要
在多通道语音增强中,有效捕获不同麦克风间的空间和频谱信息对于降噪至关重要。传统方法(如CNN或LSTM)试图对全频带和子频带频谱及空间特征的时序动态进行建模。然而,这些方法在充分建模复杂的时序依赖性方面存在局限性,尤其是在动态声学环境中。为了克服这些挑战,我们通过引入Mamba(一种状态空间模型)的改进版本来修改当前先进的McNet模型,并进一步提出MCMamba。MCMamba经过了彻底的重新设计,将全频带和窄带空间信息与子频带和全频带频谱特征相集成,提供了一种更全面的建模空间和频谱信息的方法。我们的实验结果表明,MCMamba显著改善了多通道语音增强中空间和频谱特征的建模,优于McNet并在CHiME-3数据集上达到了SOTA性能。此外,我们发现Mamba在频谱信息建模方面表现尤为出色。
引用
@article{arxiv.2409.10376,
title = {Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement},
author = {Wenze Ren and Haibin Wu and Yi-Cheng Lin and Xuanjun Chen and Rong Chao and Kuo-Hsuan Hung and You-Jin Li and Wen-Yuan Ting and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2409.10376},
year = {2025}
}
备注
Accepted by ICASSP 2025