中文

薛定谔桥 Mamba 用于一阶语音增强

声音 2026-03-06 v2 人工智能 机器学习 音频与语音处理

摘要

我们提出了薛定谔桥 Mamba (SBM),一种集成薛定谔桥 (SB) 训练范式和 Mamba 架构的新型语音增强模型。针对联合去噪和去混响任务进行实验,表明 SBM 在多个指标上优于强大的生成式和判别式方法,仅需一步推理即可实现,而且在流式可行性方面实现了具竞争力的实时因子。消融研究揭示,SB 范式在各种架构上始终优于传统映射方法。此外,Mamba 在 SB 范式下相较于多头自注意力 (MHSA) 和长短期记忆网络 (LSTM) 背板表现更佳。这些发现凸显了 Mamba 架构与 SB 轨迹化训练之间的协同作用,为实际的语音增强提供了高质量解决方案。演示页面:https://sbmse.github.io

关键词

引用

@article{arxiv.2510.16834,
  title  = {Schr\"odinger Bridge Mamba for One-Step Speech Enhancement},
  author = {Jing Yang and Sirui Wang and Chao Wu and Lei Guo and Fan Fan},
  journal= {arXiv preprint arXiv:2510.16834},
  year   = {2026}
}

备注

Revised version. Submitted to Interspeech 2026