中文

一种用于语音增强的加权方差变分自编码器模型

声音 2023-10-27 v2 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

我们研究基于变分自编码器的语音增强,其涉及在时频(TF)域中学习语音先验分布。生成模型通常假设为零均值复值高斯分布,其中语音信息编码于作为潜变量函数的方差中。与这一常用方法相反,我们提出一种加权方差生成模型,其中谱图每一时间帧在参数学习中的贡献被加权。我们对权重施加Gamma先验分布,这将有效地导致用Student's t分布而非高斯分布进行语音生成建模。我们基于所提生成模型开发了高效的训练和语音增强算法。我们在谱图自编码和语音增强上的实验结果表明,相较于标准未加权方差模型,所提方法具有有效性和鲁棒性。

关键词

引用

@article{arxiv.2211.00990,
  title  = {A weighted-variance variational autoencoder model for speech enhancement},
  author = {Ali Golmakani and Mostafa Sadeghi and Xavier Alameda-Pineda and Romain Serizel},
  journal= {arXiv preprint arXiv:2211.00990},
  year   = {2023}
}