GDiffuSE:基于噪声模型引导的扩散语音增强
声音
2026-03-03 v2 音频与语音处理
摘要
本文提出了一种基于去噪扩散概率模型 (DDPM) 的新型语音增强 (SE) 方法,称为基于引导的语音增强 (GDiffuSE)。与常规方法直接将噪声语音映射到干净语音不同,我们的方法使用一个轻量级辅助模型来估计噪声分布,然后通过引导机制将其融入扩散去噪过程中。这种设计通过启用对未见噪声类型的无缝适应,并利用原本为语音生成训练的大规模 DDPM,提高了鲁棒性。我们在将 BBC 音效数据库的噪声样本添加到 LibriSpeech 语音上进行评估,显示在不匹配噪声条件下相较于最先进的基线方法 consistently 获得改进。项目网页提供了示例。
引用
@article{arxiv.2510.04157,
title = {GDiffuSE: Diffusion-based speech enhancement with noise model guidance},
author = {Efrayim Yanir and David Burshtein and Sharon Gannot},
journal= {arXiv preprint arXiv:2510.04157},
year = {2026}
}