使用条件变分自编码器的音视觉语音增强
声音
2020-12-18 v3 机器学习
音频与语音处理
摘要
变分自编码器(VAEs)是用于学习复杂数据分布的深度生成潜变量模型。VAEs 已成功用于学习语音信号上的概率先验,随后被用于语音增强。这种生成式方法的一个优势是训练时不需要成对的干净与带噪语音信号。在本文中,我们提出用于单通道且与说话人无关的语音增强的 VAE 音视觉变体。我们开发了一种条件 VAE(CVAE),其中音频语音生成过程以唇部区域的视觉信息为条件。在测试时,音视觉语音生成模型与基于非负矩阵分解的噪声模型相结合,语音增强依赖于蒙特卡洛期望最大化算法。实验使用最近发布的 NTCD-TIMIT 数据集以及 GRID 语料库进行。结果证实所提出的音视觉 CVAE 有效融合了音频与视觉信息,并且相比仅音频的 VAE 模型提升了语音增强性能,尤其在语音信号被噪声高度污染时。我们还表明所提出的无监督音视觉语音增强方法优于最先进的监督深度学习方法。
引用
@article{arxiv.1908.02590,
title = {Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders},
author = {Mostafa Sadeghi and Simon Leglaive and Xavier Alameda-PIneda and Laurent Girin and Radu Horaud},
journal= {arXiv preprint arXiv:1908.02590},
year = {2020}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing