中文

ProSE:用于语音增强的扩散先验

音频与语音处理 2025-03-11 v1

摘要

语音增强(SE)是提升语音在非平稳叠加噪声下的清晰度和质量的基础任务。虽然常用确定性深度学习模型用于SE,但近期研究表明,如去噪扩散概率模型(DDPMs)的生成模型在此领域显示出前景。然而,与语音生成不同,SE具有强大的约束要求生成结果符合 underlying ground-truth signal。此外,对于广泛的应用,SE系统需要实时运行,传统扩散模型(DMs)在推理过程中需要大量模型迭代,效率较低。为此,我们提出ProSE(基于扩散的SE先验),一种新方法论基于替代框架将扩散模型应用于SE。具体而言,我们首先应用DDPMs在潜空间生成先验,因为其强大的分布映射能力。随后,将这些先验集成到基于转换器的回归模型中进行SE。这些先验引导增强过程中的回归模型。由于扩散过程作用于紧凑的潜空间,扩散模型所需的迭代次数少于传统DM,从而获得准确的估计。此外,使用回归模型进行SE可避免由DMs生成的误对齐细节导致的失真问题。我们的实验表明,ProSE在基准数据集上实现了更高的性能,同时计算成本更低。

关键词

引用

@article{arxiv.2503.06375,
  title  = {ProSE: Diffusion Priors for Speech Enhancement},
  author = {Sonal Kumar and Sreyan Ghosh and Utkarsh Tyagi and Anton Jeran Ratnarajah and Chandra Kiran Reddy Evuru and Ramani Duraiswami and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2503.06375},
  year   = {2025}
}

备注

Accepted at NAACL 2025