中文

基于深度卡尔曼滤波生成模型的视听语音增强

计算机视觉与模式识别 2022-11-03 v1 机器学习 声音 音频与语音处理 信号处理

摘要

基于变分自编码器(VAE)的深度潜变量生成模型在视听语音增强(AVSE)中已展现出有前景的性能。其基本思想是学习一个基于VAE的干净语音数据的视听先验分布,然后将其与统计噪声模型结合,从含噪音频记录和目标说话人的视频(唇部图像)中恢复语音信号。现有为AVSE开发的生成模型未考虑语音数据的序列特性,这阻碍了它们充分利用视觉数据的威力。本文提出一种视听深度卡尔曼滤波(AV-DKF)生成模型,其对潜变量假设一阶马尔可夫链模型并有效融合视听数据。此外,我们开发了一种高效的推断方法以在测试时估计语音信号。我们开展了一组实验来比较用于语音增强的不同生成模型变体。结果表明,AV-DKF模型相较于其纯音频版本以及非序列的纯音频和视听基于VAE的模型均具有优越性。

关键词

引用

@article{arxiv.2211.00988,
  title  = {Audio-visual speech enhancement with a deep Kalman filter generative model},
  author = {Ali Golmakani and Mostafa Sadeghi and Romain Serizel},
  journal= {arXiv preprint arXiv:2211.00988},
  year   = {2022}
}