中文

基于交叉与子带处理的状态空间模型语音增强

声音 2025-02-25 v1 音频与语音处理

摘要

最近,由 Mamba 表示的状态空间模型 (SSM) 在长期序列建模任务中展现出卓越的性能,包括语音增强。然而,由于子带特征之间的差异显著,将相同的 SSM 应用于所有子带会限制其推理能力。此外,在处理时频表示的每个时间帧时,SSM 可能会忘记低能量的高频信息,这使得恢复高频带的结构具有挑战性。为此,我们提出了交叉与子带 Mamba (CSMamba)。为帮助 SSM 在处理不同子带特征时具有更好的灵活性,我们提出了带划分模块,将全带信号划分为基于信息相似性的四个不同宽度的子带。我们随后为每个子带分配独立的权重,从而减轻 SSM 的推理负担。此外,为缓解 SSM 对高频带中低能量信息的遗忘,我们引入了光谱恢复模块,从多个角度增强来自跨带特征的表示。在 DNS Challenge 2021 数据集上的实验结果表明,CSMamba 在三个客观评估指标上均优于几种最新 (SOTA) 语音增强方法,且参数更少。

关键词

引用

@article{arxiv.2502.16207,
  title  = {Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model},
  author = {Jizhen Li and Weiping Tu and Yuhong Yang and Xinmeng Xu and Yiqun Zhang and Yanzhen Ren},
  journal= {arXiv preprint arXiv:2502.16207},
  year   = {2025}
}