中文

利用判别式潜在表征调节基于GAN的语音增强

音频与语音处理 2025-08-29 v1

摘要

基于生成对抗网络(GAN)和扩散模型的生成式语音增强方法在各种语音增强任务中显示出有前景的结果。然而,它们在极低信噪比(SNR)场景下的性能仍然未被充分探索且受限,因为这些条件对判别式和生成式SOTA方法都构成了重大挑战。为了解决这个问题,我们提出了一种方法,利用从判别式语音增强模型中提取的潜在特征作为通用调节特征,以改进基于GAN的语音增强。所提出的方法称为DisCoGAN,在低SNR场景中表现出优于基线模型的性能改进,同时在高SNR条件和真实世界录音中保持具有竞争力或更优的性能。我们还对传统的基于GAN的架构进行了全面评估,包括端到端训练的GAN、作为第一处理阶段的GAN和后滤波GAN,以及低SNR条件下的判别式模型。我们表明DisCoGAN始终优于现有方法。最后,我们提出了一项消融研究,考察了DisCoGAN中各个组件的贡献,并分析了判别式调节方法对整体性能的影响。

关键词

引用

@article{arxiv.2508.20859,
  title  = {Leveraging Discriminative Latent Representations for Conditioning GAN-Based Speech Enhancement},
  author = {Shrishti Saha Shetu and Emanuël A. P. Habets and Andreas Brendel},
  journal= {arXiv preprint arXiv:2508.20859},
  year   = {2025}
}

备注

This manuscript has been submitted to IEEE Transactions on Audio, Speech and Language Processing