中文

SEMamba++: 基于全局、局部与周期性频谱模式的通用语音恢复框架

音频与语音处理 2026-03-13 v1 声音

摘要

通用语音恢复需要能够在各种失真条件下解释复杂语音结构的技术。虽然基于状态空间模型的 SEMamba 在语音去噪方面取得了进步, 但并非针对关键语音特征(如频谱周期性或多分辨率频率分析)进行优化。本文引入一种针对语音特定特征作为归纳偏置的架构。具体而言, 我们提出 Frequency GLP, 一个高效利用频率 bins 属性的频率特征提取模块。随后, 我们设计了多分辨率平行时频双处理模块以捕获多样化频谱模式, 并引入可学习的映射以进一步提升模型性能。通过综合上述所有思想, SEMamba++ 在多个基线模型中实现了最佳性能, 同时保持计算效率。

关键词

引用

@article{arxiv.2603.11669,
  title  = {SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns},
  author = {Yongjoon Lee and Jung-Woo Choi},
  journal= {arXiv preprint arXiv:2603.11669},
  year   = {2026}
}

备注

Submitted to Interspeech 2026