DeepFilterGAN:一种基于 GAN 随机再生的全频带实时语音增强系统
音频与语音处理
2025-05-30 v1 机器学习
信号处理
摘要
在这项工作中,我们提出了一种基于 GAN 随机再生的全频带实时语音增强系统。预测模型侧重于估计目标分布的均值,而生成模型旨在学习完整分布。预测模型的这种行为可能导致过度抑制,即去除语音内容。文献表明,在随机再生框架内将预测模型与生成模型相结合,可以减少输出中的失真。我们使用该框架来获得一个实时语音增强系统。凭借 3.58M 参数和低延迟,我们的系统专为具有轻量级架构的实时流处理而设计。实验表明,我们的系统在 NISQA-MOS 指标上较第一阶段有所提升。最后,通过消融实验,我们展示了系统中噪声条件的重要性。我们带着该模型参加了 2025 Urgent Challenge,随后进行了进一步改进。
引用
@article{arxiv.2505.23515,
title = {DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration},
author = {Sanberk Serbest and Tijana Stojkovic and Milos Cernak and Andrew Harper},
journal= {arXiv preprint arXiv:2505.23515},
year = {2025}
}
备注
Accepted to Interspeech 2025