一种用于语音增强的加权方差变分自编码器模型
声音
2023-10-27 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
我们研究基于变分自编码器的语音增强,其涉及在时频(TF)域中学习语音先验分布。生成模型通常假设为零均值复值高斯分布,其中语音信息编码于作为潜变量函数的方差中。与这一常用方法相反,我们提出一种加权方差生成模型,其中谱图每一时间帧在参数学习中的贡献被加权。我们对权重施加Gamma先验分布,这将有效地导致用Student's t分布而非高斯分布进行语音生成建模。我们基于所提生成模型开发了高效的训练和语音增强算法。我们在谱图自编码和语音增强上的实验结果表明,相较于标准未加权方差模型,所提方法具有有效性和鲁棒性。
引用
@article{arxiv.2211.00990,
title = {A weighted-variance variational autoencoder model for speech enhancement},
author = {Ali Golmakani and Mostafa Sadeghi and Xavier Alameda-Pineda and Romain Serizel},
journal= {arXiv preprint arXiv:2211.00990},
year = {2023}
}