基于薛定谔桥和对称噪声计划的扩散语音增强
音频与语音处理
2024-09-16 v2 声音
摘要
最近,基于扩散的生成模型在语音增强任务中展现出卓越的性能。然而,这些方法仍面临结构信息不足以及在低信噪比(SNR)场景下性能不佳的挑战。为克服这些挑战,我们提出了基于薛定谔桥的语音增强(SBSE)方法,它直接学习噪声输入与干净分布之间的扩散过程,不同于传统的基于扩散的语音增强系统学习数据到高斯分布的过程。为增强在极端噪声条件下的性能,我们引入了一个两阶段系统,将比率掩码信息整合到基于扩散的生成模型中。我们的实验结果表明,我们提出的 SBSE 方法在所有基准模型中均取得优异性能,尤其在低 SNR 条件下达到了最先进的水平。重要的是,只需少量的推理步骤即可获得最佳结果。
引用
@article{arxiv.2409.05116,
title = {Diffusion-based Speech Enhancement with Schr\"odinger Bridge and Symmetric Noise Schedule},
author = {Siyi Wang and Siyi Liu and Andrew Harper and Paul Kendrick and Mathieu Salzmann and Milos Cernak},
journal= {arXiv preprint arXiv:2409.05116},
year = {2024}
}