中文

一种基于变分自编码器的统计原则性强且计算高效的语音增强方法

声音 2019-05-15 v2 机器学习 音频与语音处理 机器学习

摘要

近期的研究探索了使用基于变分自编码器(VAEs)的语音频谱深度生成模型,结合无监督噪声模型来执行语音增强。这些研究开发了在每一步包含 Gibbs 采样或梯度下降的迭代算法,使其计算成本高昂。本文提出了一种变分推断方法,用于迭代估计纯净语音的功率谱图。我们的主要贡献是解析推导了变分步骤,其中预训练 VAE 的编码器可用于估计真实后验分布的变分近似,所用的假设与训练 VAE 的假设完全相同。实验表明,所提出的方法产生的结果与上述使用采样的迭代方法相当,同时将达到给定性能的计算成本降低了 36 倍。

关键词

引用

@article{arxiv.1905.01209,
  title  = {A Statistically Principled and Computationally Efficient Approach to Speech Enhancement using Variational Autoencoders},
  author = {Manuel Pariente and Antoine Deleforge and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:1905.01209},
  year   = {2019}
}

备注

Submitted to INTERSPEECH 2019