中文

DeepFilterGAN:一种基于 GAN 随机再生的全频带实时语音增强系统

音频与语音处理 2025-05-30 v1 机器学习 信号处理

摘要

在这项工作中,我们提出了一种基于 GAN 随机再生的全频带实时语音增强系统。预测模型侧重于估计目标分布的均值,而生成模型旨在学习完整分布。预测模型的这种行为可能导致过度抑制,即去除语音内容。文献表明,在随机再生框架内将预测模型与生成模型相结合,可以减少输出中的失真。我们使用该框架来获得一个实时语音增强系统。凭借 3.58M 参数和低延迟,我们的系统专为具有轻量级架构的实时流处理而设计。实验表明,我们的系统在 NISQA-MOS 指标上较第一阶段有所提升。最后,通过消融实验,我们展示了系统中噪声条件的重要性。我们带着该模型参加了 2025 Urgent Challenge,随后进行了进一步改进。

关键词

引用

@article{arxiv.2505.23515,
  title  = {DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration},
  author = {Sanberk Serbest and Tijana Stojkovic and Milos Cernak and Andrew Harper},
  journal= {arXiv preprint arXiv:2505.23515},
  year   = {2025}
}

备注

Accepted to Interspeech 2025