中文

一种用于语音增强的贝叶斯置换训练深度表示学习方法与变分自编码器

音频与语音处理 2022-01-25 v1 声音

摘要

近年来,变分自编码器(VAE)作为一种深度表示学习(DRL)模型,已被用于执行语音增强(SE)。然而,据我们所知,当前基于 VAE 的 SE 方法仅将 VAE 应用于语音信号建模,而噪声则使用传统的非负矩阵分解(NMF)模型进行建模。使用 NMF 的最重要原因之一是这些基于 VAE 的方法无法从观测信号中解耦语音和噪声的隐变量。基于贝叶斯理论,本文为 VAE 推导出一个新颖的变分下界,该下界确保 VAE 能够以有监督的方式进行训练,并能从观测信号中解耦语音和噪声的隐变量。这意味着所提出的方法可以应用 VAE 同时对语音和噪声信号进行建模,这与以往基于 VAE 的 SE 工作完全不同。更具体地说,所提出的 DRL 方法能够学习将语音和噪声信号的先验施加到不同的隐变量集合上以进行 SE。实验结果表明,所提出的方法不仅能够从观测信号中解耦语音和噪声的隐变量,而且相比类似的基于深度神经网络(DNN)的 SE 方法,获得了更高的尺度不变信号失真比和语音质量评分。

关键词

引用

@article{arxiv.2201.09875,
  title  = {A Bayesian Permutation training deep representation learning method for speech enhancement with variational autoencoder},
  author = {Yang Xiang and Jesper Lisby Højvang and Morten Højfeldt Rasmussen and Mads Græsbøll Christensen},
  journal= {arXiv preprint arXiv:2201.09875},
  year   = {2022}
}

备注

Accepted by ICASSP 2022