中文

用于噪声不可知音视频语音增强的切换变分自编码器

音频与语音处理 2021-02-09 v1 计算机视觉与模式识别 声音

摘要

近来,音视频语音增强在无监督设定下基于变分自编码器(VAE)得到处理,其中训练时仅使用干净数据训练语音的生成模型,在测试时将其与噪声模型(如非负矩阵分解(NMF))结合,后者的参数在无监督下学习。因此,所提模型对噪声类型不可知。当视觉数据干净时,基于音视频 VAE 的架构通常优于仅音频的对应架构。当视觉数据被杂波污染(例如说话者未正对相机)时则相反。本文中,我们提出随时间寻找这两种架构的最优组合。更确切地说,我们引入具有马尔可夫依赖的潜在序列变量,以无监督方式随时间在不同 VAE 架构间切换:即切换变分自编码器(SwVAE)。我们提出一种变分分解来近似计算上难处理的后验分布。我们还推导了相应的变分期望最大化算法以估计模型参数并增强语音信号。我们的实验展示了 SwVAE 的良好性能。

关键词

引用

@article{arxiv.2102.04144,
  title  = {Switching Variational Auto-Encoders for Noise-Agnostic Audio-visual Speech Enhancement},
  author = {Mostafa Sadeghi and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2102.04144},
  year   = {2021}
}

备注

2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)