中文

基于扩散生成模型的无监督语音增强

计算机视觉与模式识别 2023-09-20 v1 声音 音频与语音处理 信号处理 机器学习

摘要

近来,条件分数扩散模型在有监督语音增强领域备受关注,取得了最先进的性能。然而,这些方法在泛化到未见条件时可能面临挑战。为解决此问题,我们引入一种以无监督方式运行的替代方法,利用扩散模型的生成能力。具体而言,在训练阶段,使用基于分数的扩散模型在短时傅里叶变换(short-time Fourier transform, STFT)域学习干净语音先验分布,使其能从高斯噪声无条件生成干净语音。然后,我们结合学到的干净语音先验与用于语音信号推断的噪声模型,发展了用于语音增强的后验采样方法。噪声参数通过迭代期望最大化(expectation-maximisation, EM)方法与干净语音估计同时学习。据我们所知,这是首个探索基于扩散生成模型进行无监督语音增强的工作,相比近期基于变分自编码器(variational auto-encoder, VAE)的无监督方法与最先进的基于扩散的有监督方法,展示了有前景的结果。从而开辟了无监督语音增强未来研究的新方向。

关键词

引用

@article{arxiv.2309.10450,
  title  = {Unsupervised speech enhancement with diffusion-based generative models},
  author = {Berné Nortier and Mostafa Sadeghi and Romain Serizel},
  journal= {arXiv preprint arXiv:2309.10450},
  year   = {2023}
}