中文

基于并行序列建模的幅度和相位感知语音增强

音频与语音处理 2023-10-12 v1

摘要

在语音增强(SE)中,相位估计对感知质量十分重要,因此许多方法以干净语音的复数短时傅里叶变换(STFT)谱或复数理想比率掩码(cIRM)作为学习目标。为预测这些复数目标,常见方案是设计复数神经网络,或使用实数网络分别预测目标的实部和虚部。但在本文中,我们提出使用实数网络估计幅度掩码和归一化 cIRM,这不仅避免了复数网络带来的模型复杂度显著增加,还展现出优于以往相位估计方法的性能。同时,我们设计了一个并行序列建模(PSM)块来改进基于卷积循环网络(CRN)的 SE 模型中的 RNN 块。我们将所提方法命名为基于幅度和相位感知及 PSM 的 CRN(MPCRN)。实验结果表明,我们的 MPCRN 具有更优的 SE 性能。

关键词

引用

@article{arxiv.2310.07316,
  title  = {Magnitude-and-phase-aware Speech Enhancement with Parallel Sequence Modeling},
  author = {Yuewei Zhang and Huanbin Zou and Jie Zhu},
  journal= {arXiv preprint arXiv:2310.07316},
  year   = {2023}
}

备注

Accepted by ASRU 2023