中文

基于变分自编码器与非负矩阵分解概率集成的统计语音增强

声音 2019-03-12 v4 机器学习 音频与语音处理 机器学习

摘要

本文提出一种使用变分自编码器(VAE)作为干净语音先验分布的单通道语音增强统计方法。语音增强的标准方法是训练深度神经网络(DNN)以带噪语音为输入并输出干净语音。尽管这种监督方法需要极大量的配对数据用于训练,但它对未知环境不具鲁棒性。另一方法是使用基于事先在干净语音上训练、并即时适配噪声的基频谱的非负矩阵分解(NMF)。然而,这种半监督方法由于语音谱图是基频谱线性组合这一不现实假设,导致增强语音中明显的信号失真。我们用在干净语音上训练的 VAE——一种强大的非线性深度生成模型——替换 NMF 中干净语音的欠佳线性生成模型,由此表述了带噪语音的统一概率生成模型。给定带噪语音作为观测数据,我们可从其后验分布中采样干净语音。所提方法在未知噪声环境中优于传统的基于 DNN 的方法。

关键词

引用

@article{arxiv.1710.11439,
  title  = {Statistical Speech Enhancement Based on Probabilistic Integration of Variational Autoencoder and Non-Negative Matrix Factorization},
  author = {Yoshiaki Bando and Masato Mimura and Katsutoshi Itoyama and Kazuyoshi Yoshii and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:1710.11439},
  year   = {2019}
}

备注

5 pages, 3 figures, version that Eqs. (9), (19), and (20) in v2 (submitted to ICASSP 2018) are corrected. Samples available here: http://sap.ist.i.kyoto-u.ac.jp/members/yoshiaki/demo/vae-nmf/