中文

减小基于扩散的语音增强中随机微分方程的先验失配

音频与语音处理 2023-05-31 v2 机器学习 声音

摘要

近来,基于分数的生成模型已成功应用于语音增强任务。随机微分方程被用于建模迭代前向过程,其中在每一步向干净语音信号添加环境噪声与白高斯噪声。虽然在极限下前向过程的均值终止于含噪混合信号,但在实际中它更早停止,因此仅终止于含噪混合信号的近似。这导致前向过程的终止分布与推理时用于求解反向过程的先验之间存在差异。在本文中,我们处理该差异并提出了一种基于布朗桥的前向过程。我们表明,与先前的扩散过程相比,此类过程可减小失配。更重要的是,我们表明我们的方法仅用一半的迭代步数且少一个待调超参数,即在客观指标上优于基线过程。

关键词

引用

@article{arxiv.2302.14748,
  title  = {Reducing the Prior Mismatch of Stochastic Differential Equations for Diffusion-based Speech Enhancement},
  author = {Bunlong Lay and Simon Welker and Julius Richter and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2302.14748},
  year   = {2023}
}

备注

5 pages, 2 figures, Accepted to Interspeech 20223