中文

基于回归与生成式 Mamba 的通用语音增强

声音 2025-10-01 v2 音频与语音处理

摘要

Interspeech 2025 URGENT 挑战赛旨在通过统一各种条件下的语音增强任务来推进通用、鲁棒且可泛化的语音增强,这些条件包括七种不同的失真类型和五种语言。我们提出了通用语音增强 Mamba(USEMamba),这是一种状态空间语音增强模型,旨在处理长程序列建模、时频结构化处理以及与采样频率无关的特征提取。我们的方法主要依赖于基于回归的建模,该建模在大多数失真情况下表现良好。然而,对于必须推断缺失内容的丢包和带宽扩展,所提出的 USEMamba 的生成式变体被证明更为有效。尽管仅在完整训练数据的一个子集上进行训练,USEMamba 在盲测阶段的 Track 1 中获得了第二名,展示了在不同条件下的强大泛化能力。

关键词

引用

@article{arxiv.2505.21198,
  title  = {Universal Speech Enhancement with Regression and Generative Mamba},
  author = {Rong Chao and Rauf Nasretdinov and Yu-Chiang Frank Wang and Ante Jukić and Szu-Wei Fu and Yu Tsao},
  journal= {arXiv preprint arXiv:2505.21198},
  year   = {2025}
}

备注

Accepted to Interspeech 2025