基于变分自编码器混合的鲁棒无监督视听语音增强
音频与语音处理
2019-11-12 v1 机器学习
声音
摘要
近来,提出了一种基于变分自编码器 (VAE) 的视听语音生成模型,其与用于噪声方差的非负矩阵分解 (NMF) 模型相结合以执行无监督语音增强。当视觉数据干净时,使用视听 VAE 的语音增强表现出优于使用仅在音频数据上训练的纯音频 VAE 的性能。然而,视听 VAE 对含噪视觉数据不具备鲁棒性,例如当某些视频帧中说话人面部非正面或嘴唇区域被遮挡时。本文提出一种基于逐帧 VAE 混合模型的鲁棒无监督视听语音增强方法。该混合模型由一个训练好的纯音频 VAE 与一个训练好的视听 VAE 组成。其动机是通过切换到纯音频 VAE 模型来跳过含噪视觉帧。我们给出了一种变分期望最大化方法来估计模型参数。实验显示了所提方法的前景性能。
引用
@article{arxiv.1911.03930,
title = {Robust Unsupervised Audio-visual Speech Enhancement Using a Mixture of Variational Autoencoders},
author = {Mostafa Sadeghi and Xavier Alameda-Pineda},
journal= {arXiv preprint arXiv:1911.03930},
year = {2019}
}