中文

NADiffuSE:基于噪声感知扩散模型的语音增强方法

声音 2023-09-06 v1 音频与语音处理

摘要

语音增强(SE)的目标是从带噪语音信号中消除背景干扰。诸如扩散模型(DM)之类的生成模型因在未知噪声场景下更好的泛化能力而被应用于 SE 任务。基于 DM 的 SE 方法的技术路线可归纳为三类:任务适配的扩散过程 formulation、生成器加条件器(GPC)结构以及多阶段框架。我们关注前两类方法,其构建于 GPC 架构之下并利用任务适配的扩散过程以更好地处理真实噪声。然而,这些 SE 模型的性能受限于以下问题:(a)任务适配扩散过程中的非高斯噪声估计。(b)GPC 结构中弱条件器设计引起的条件域偏置。(c)推理过程中不合理插值操作导致的大量残差噪声。为解决上述问题,我们提出一种基于噪声感知扩散的 SE 模型(NADiffuSE)以提升 SE 性能,其中从带噪语音信号中提取噪声表示并作为全局条件信息引入以估计非高斯分量。此外,采用基于锚点的推理算法,在语音失真与噪声残差之间取得折中。为缓解 GPC 框架中条件域偏置引起的性能退化,我们研究了三种模型变体,均可视为基于梅尔谱图预处理网络的多阶段 SE。实验结果表明,在 GPC 架构下 NADiffuSE 优于其他基于 DM 的 SE 模型。音频样本见:https://square-of-w.github.io/NADiffuSE-demo/。

关键词

引用

@article{arxiv.2309.01212,
  title  = {NADiffuSE: Noise-aware Diffusion-based Model for Speech Enhancement},
  author = {Wen Wang and Dongchao Yang and Qichen Ye and Bowen Cao and Yuexian Zou},
  journal= {arXiv preprint arXiv:2309.01212},
  year   = {2023}
}