中文

基于变分自编码器混合的鲁棒无监督视听语音增强

音频与语音处理 2019-11-12 v1 机器学习 声音

摘要

近来,提出了一种基于变分自编码器 (VAE) 的视听语音生成模型,其与用于噪声方差的非负矩阵分解 (NMF) 模型相结合以执行无监督语音增强。当视觉数据干净时,使用视听 VAE 的语音增强表现出优于使用仅在音频数据上训练的纯音频 VAE 的性能。然而,视听 VAE 对含噪视觉数据不具备鲁棒性,例如当某些视频帧中说话人面部非正面或嘴唇区域被遮挡时。本文提出一种基于逐帧 VAE 混合模型的鲁棒无监督视听语音增强方法。该混合模型由一个训练好的纯音频 VAE 与一个训练好的视听 VAE 组成。其动机是通过切换到纯音频 VAE 模型来跳过含噪视觉帧。我们给出了一种变分期望最大化方法来估计模型参数。实验显示了所提方法的前景性能。

关键词

引用

@article{arxiv.1911.03930,
  title  = {Robust Unsupervised Audio-visual Speech Enhancement Using a Mixture of Variational Autoencoders},
  author = {Mostafa Sadeghi and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:1911.03930},
  year   = {2019}
}