基于扩散的语音增强及其加权生成-监督学习损失
计算机视觉与模式识别
2023-09-20 v1 声音
音频与语音处理
信号处理
机器学习
摘要
基于扩散的生成模型近期在语音增强(SE)中受到关注,为传统监督方法提供了替代方案。这些模型将干净语音训练样本转化为以带噪语音为中心的高斯噪声,随后学习一个参数化模型来逆转该过程,并以带噪语音为条件。与监督方法不同,基于生成的 SE 方法通常仅依赖无监督损失,可能导致对条件带噪语音的利用不够高效。为解决此问题,我们提出用均方误差(MSE)损失增强原始扩散训练目标,该损失度量每次逆向过程迭代中估计增强语音与真实干净语音间的差异。实验结果证明了我们所提方法的有效性。
引用
@article{arxiv.2309.10457,
title = {Diffusion-based speech enhancement with a weighted generative-supervised learning loss},
author = {Jean-Eudes Ayilo and Mostafa Sadeghi and Romain Serizel},
journal= {arXiv preprint arXiv:2309.10457},
year = {2023}
}