基于复 STFT 域分数生成模型的语音增强
音频与语音处理
2022-07-08 v2 机器学习
声音
摘要
分数生成模型(SGMs)最近在诸如自然图像与音频信号的无条件和条件生成等困难生成任务上展示了令人印象深刻的成果。在本工作中,我们将这些模型扩展到复短时傅里叶变换(STFT)域,提出了一种使用复值深度神经网络的语音增强新训练任务。我们在随机微分方程(SDEs)的形式体系下推导了该训练任务,从而能够使用预测-校正采样器。我们提供了受先前关于使用生成扩散模型进行语音增强的文献启发的替代公式,避免了对噪声分布的任何先验假设,并使训练任务成为纯生成式,正如我们所展示的,这带来了增强性能的提升。
引用
@article{arxiv.2203.17004,
title = {Speech Enhancement with Score-Based Generative Models in the Complex STFT Domain},
author = {Simon Welker and Julius Richter and Timo Gerkmann},
journal= {arXiv preprint arXiv:2203.17004},
year = {2022}
}
备注
Accepted by Interspeech 2022