中文

基于扩散生成模型的语音增强与去混响

音频与语音处理 2025-10-14 v3 机器学习 声音

摘要

本工作中,我们基于先前发表的研究,使用基于扩散的生成模型进行语音增强。我们详细概述了基于随机微分方程的扩散过程,并深入理论考察其含义。与通常的条件生成任务相反,我们的反向过程并非从纯高斯噪声开始,而是从含噪语音与高斯噪声的混合物开始。这与我们的前向过程一致,该前向过程通过引入漂移项从干净语音移至含噪语音。我们表明此过程仅需30个扩散步即可生成高质量的干净语音估计。通过调整网络架构,我们能够显著改善语音增强性能,表明网络而非形式体系是我们原始方法的主要局限。在广泛的跨数据集评估中,我们表明改进方法可与近期判别模型竞争,并在不同于训练所用语料上评估时取得更好泛化。我们以使用真实世界含噪录音的仪器化评估及听感实验补充结果,其中所提方法被评为最佳。考察求解反向过程的不同采样器配置使我们能平衡所提方法的性能与计算速度。此外,我们表明所提方法也适用于去混响,因此不限于加性背景噪声去除。代码与音频示例在线可用,见https://github.com/sp-uhh/sgmse。

关键词

引用

@article{arxiv.2208.05830,
  title  = {Speech Enhancement and Dereverberation with Diffusion-based Generative Models},
  author = {Julius Richter and Simon Welker and Jean-Marie Lemercier and Bunlong Lay and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2208.05830},
  year   = {2025}
}

备注

Proofread version