SEMamba++: 基于全局、局部与周期性频谱模式的通用语音恢复框架
音频与语音处理
2026-03-13 v1 声音
摘要
通用语音恢复需要能够在各种失真条件下解释复杂语音结构的技术。虽然基于状态空间模型的 SEMamba 在语音去噪方面取得了进步, 但并非针对关键语音特征(如频谱周期性或多分辨率频率分析)进行优化。本文引入一种针对语音特定特征作为归纳偏置的架构。具体而言, 我们提出 Frequency GLP, 一个高效利用频率 bins 属性的频率特征提取模块。随后, 我们设计了多分辨率平行时频双处理模块以捕获多样化频谱模式, 并引入可学习的映射以进一步提升模型性能。通过综合上述所有思想, SEMamba++ 在多个基线模型中实现了最佳性能, 同时保持计算效率。
引用
@article{arxiv.2603.11669,
title = {SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns},
author = {Yongjoon Lee and Jung-Woo Choi},
journal= {arXiv preprint arXiv:2603.11669},
year = {2026}
}
备注
Submitted to Interspeech 2026