中文

GDiffuSE:基于噪声模型引导的扩散语音增强

声音 2026-03-03 v2 音频与语音处理

摘要

本文提出了一种基于去噪扩散概率模型 (DDPM) 的新型语音增强 (SE) 方法,称为基于引导的语音增强 (GDiffuSE)。与常规方法直接将噪声语音映射到干净语音不同,我们的方法使用一个轻量级辅助模型来估计噪声分布,然后通过引导机制将其融入扩散去噪过程中。这种设计通过启用对未见噪声类型的无缝适应,并利用原本为语音生成训练的大规模 DDPM,提高了鲁棒性。我们在将 BBC 音效数据库的噪声样本添加到 LibriSpeech 语音上进行评估,显示在不匹配噪声条件下相较于最先进的基线方法 consistently 获得改进。项目网页提供了示例。

关键词

引用

@article{arxiv.2510.04157,
  title  = {GDiffuSE: Diffusion-based speech enhancement with noise model guidance},
  author = {Efrayim Yanir and David Burshtein and Sharon Gannot},
  journal= {arXiv preprint arXiv:2510.04157},
  year   = {2026}
}