中文

基于变分自编码器的语音增强方差建模框架

声音 2019-02-06 v1 机器学习 音频与语音处理 机器学习

摘要

本文中,我们采用源分离方法解决噪声混合中语音信号增强问题。我们探索使用神经网络作为基于监督非负矩阵分解(NMF)的流行语音方差模型的替代方案。更确切地说,我们使用变分自编码器作为与说话人无关的监生成式语音模型,突出该方法与其基于NMF对应方案所共有的概念相似性。为免于噪声录音环境的泛化问题,我们遵循仅对目标语音信号使用监督模型、噪声模型基于无监督NMF的方法。我们开发了蒙特卡洛期望最大化算法,用于推断变分自编码器中的潜变量并估计无监督模型参数。实验表明,所提方法优于半监督NMF基线及最先进的完全监督深度学习方法。

关键词

引用

@article{arxiv.1902.01605,
  title  = {A variance modeling framework based on variational autoencoders for speech enhancement},
  author = {Simon Leglaive and Laurent Girin and Radu Horaud},
  journal= {arXiv preprint arXiv:1902.01605},
  year   = {2019}
}

备注

6 pages, 3 figures