中文

基于扩散的语音增强中方差的分析

音频与语音处理 2024-06-14 v2 机器学习 声音

摘要

扩散模型被证明是生成式语音增强的强大模型。在最近的SGMSE+方法中,训练涉及一个用于扩散过程的随机微分方程,逐步向干净语音信号添加高斯噪声和环境噪声。语音增强性能取决于控制扩散过程中均值和方差演变的随机微分方程的选择,当添加环境噪声和高斯噪声时。在这项工作中,我们强调方差的尺度是语音增强性能的主导参数,并表明它控制了噪声衰减与语音失真之间的权衡。更具体地说,我们表明较大的方差增加了噪声衰减,并允许减少计算开销,因为生成估计所需的函数评估次数更少。

关键词

引用

@article{arxiv.2402.00811,
  title  = {An Analysis of the Variance of Diffusion-based Speech Enhancement},
  author = {Bunlong Lay and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2402.00811},
  year   = {2024}
}

备注

5 pages, 3 figures, 1 table