MP-SENet:一种对幅度谱与相位谱并行去噪的语音增强模型
音频与语音处理
2024-01-15 v1
摘要
本文提出 MP-SENet,一种新颖的语音增强网络,可直接并行地对幅度谱与相位谱进行去噪。所提出的 MP-SENet 采用编解码器架构,其中编码器与解码器由卷积增强的 transformers 桥接。编码器旨在从输入的含噪幅度谱与相位谱中编码时频表示。解码器由并行的幅度掩码解码器与相位解码器组成,分别通过可学习的 sigmoid 激活与并行相位估计架构直接恢复干净的幅度谱与干净包裹相位谱。定义在幅度谱、相位谱、短时复谱以及时域波形上的多级损失被用于联合训练 MP-SENet 模型。实验结果表明,我们提出的 MP-SENet 在公开 VoiceBank+DEMAND 数据集上取得了 3.50 的 PESQ,并且优于现有的先进语音增强方法。
引用
@article{arxiv.2305.13686,
title = {MP-SENet: A Speech Enhancement Model with Parallel Denoising of Magnitude and Phase Spectra},
author = {Ye-Xin Lu and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2305.13686},
year = {2024}
}
备注
Accepted by Interspeech 2023