用于生成式语音增强的少步对抗 Schrödinger Bridge
声音
2025-06-03 v1 音频与语音处理
摘要
近期,深度生成模型已被用于语音增强,以在大规模数据集上生成感知上有效的干净语音。目前已提出多种扩散模型,并且最近还引入了一种易于处理的 Schrödinger Bridge,用于在干净与含噪语音分布之间进行传输。然而,这些模型通常受限于迭代反向过程,并需要大量的采样步骤——超过 50 步。我们的研究表明,当减少采样步骤数时,基线模型的性能会显著下降,尤其是在低信噪比(SNR)条件下。我们提出将 Schrödinger Bridge 与 GAN 相结合以有效缓解这一问题,在全频带数据集上实现高质量输出的同时,大幅减少所需的采样步骤。实验结果表明,即使在单次推理步骤下,我们提出的模型在去噪与去混响任务中均优于现有基线。
引用
@article{arxiv.2506.01460,
title = {Few-step Adversarial Schr\"{o}dinger Bridge for Generative Speech Enhancement},
author = {Seungu Han and Sungho Lee and Juheon Lee and Kyogu Lee},
journal= {arXiv preprint arXiv:2506.01460},
year = {2025}
}
备注
Accepted to Interspeech 2025