中文

用于高质量语音增强的幅度与相位谱并行显式估计

音频与语音处理 2024-04-02 v2 声音

摘要

相位信息对语音感知质量和可懂度有显著影响。然而,现有语音增强方法由于相位的非结构特性和包裹特性,在显式相位估计方面存在局限,导致增强语音质量遇到瓶颈。为克服上述问题,本文提出 MP-SENet,一种显式并行增强幅度与相位谱的新型语音增强网络。所提 MP-SENet 包含嵌入 Transformer 的编码器-解码器架构。编码器旨在将输入失真幅度谱和相位谱编码为时频表示,并进一步送入时频 Transformer 以交替捕获时间和频率依赖关系。解码器包括幅度掩码解码器和相位解码器,分别通过引入幅度掩码架构和相位并行估计架构直接增强幅度谱和包裹相位谱。采用在幅度谱、包裹相位谱和短时复谱上明确定义的多级损失函数来联合训练 MP-SENet 模型。进一步采用度量判别器来补偿这些损失与人类听觉感知之间的不完全相关性。实验结果表明,我们提出的 MP-SENet 在包括语音去噪、去混响和带宽扩展在内的多个语音增强任务中取得了最先进的性能。与现有感知相位的语音增强方法相比,它通过显式相位估计进一步缓解了幅度与相位之间的补偿效应,提升了增强语音的感知质量。

关键词

引用

@article{arxiv.2308.08926,
  title  = {Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement},
  author = {Ye-Xin Lu and Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2308.08926},
  year   = {2024}
}

备注

Submmited to IEEE Transactions on Audio, Speech and Language Processing