中文

基于扩散的无监督语音增强框架

声音 2026-05-26 v4

摘要

本文探讨了基于扩散的无监督单通道语音增强(SE)。该方向的先前工作将基于分数的扩散模型(在干净语音上训练)与一个高斯噪声模型相结合,该噪声模型的协方差由非负矩阵分解(NMF)构建。这种组合用于一个迭代的期望最大化(EM)方案中,其中基于扩散的后验采样E步估计干净语音。我们首先重新审视此框架,并提出将语音和声学噪声都显式地建模为潜变量,在E步中联合采样它们,而不是像先前方法那样仅采样语音。然后,我们引入了一个新的半监督SE框架,该框架用一个基于扩散的噪声模型替换了NMF噪声先验,该噪声模型与语音先验在一个单一的条件分数模型中联合学习。在此框架内,我们推导出两种变体:一种隐式地考虑噪声,另一种显式地将噪声视为潜变量。在WSJ0-QUT和VoiceBank-DEMAND上的实验表明,显式噪声建模系统地提高了基于NMF和基于扩散的噪声先验的SE性能。在匹配条件下,基于扩散的噪声模型在无监督方法中获得了最佳的整体质量和可懂度,而在不匹配条件下,所提出的基于NMF的显式噪声框架更为鲁棒,并且比几个有监督基线遭受更少的性能下降。代码、演示和补充材料已公开可用。

关键词

引用

@article{arxiv.2601.09931,
  title  = {Diffusion-based Frameworks for Unsupervised Speech Enhancement},
  author = {Jean-Eudes Ayilo and Mostafa Sadeghi and Romain Serizel and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2601.09931},
  year   = {2026}
}