中文

用于基于 VAE 的音视频语音增强的推理网络混合

音频与语音处理 2021-03-10 v4 计算机视觉与模式识别 声音

摘要

在本文中,我们关注基于变分自编码器(VAE)的无监督(未知噪声)音视频语音增强,其中干净语音谱的概率分布使用编码器-解码器架构来模拟。训练好的生成模型(解码器)随后在测试时与噪声模型结合以估计干净语音。在语音增强阶段(测试时),描述通过解码器生成干净语音过程的潜变量的初始化至关重要,因为整体推断问题是非凸的。这通常通过使用训练好的编码器的输出来完成,其中给定带噪音频和干净视觉数据作为输入。当前的音视频 VAE 模型未提供有效的初始化,因为其相关架构中两种模态紧密耦合(拼接)。为克服此问题,受混合模型启发,我们引入推理网络混合变分自编码器(MIN-VAE)。两个编码器网络分别输入音频和视觉数据,潜变量的后验被建模为来自每个编码器网络的两个高斯分布的混合。混合变量也是潜变量,因此学习音频与视觉推理网络间最优平衡的推断也是无监督的。通过训练共享解码器,整体网络学习自适应融合两种模态。此外,在测试时,采用输入(干净)视觉数据的视觉编码器进行初始化。推导了一种变分推断方法来训练所提出的生成模型。得益于新颖的推断过程和鲁棒初始化,所提出的 MIN-VAE 在语音增强上展现出优于标准纯音频及音视频对应模型的性能。

关键词

引用

@article{arxiv.1912.10647,
  title  = {Mixture of Inference Networks for VAE-based Audio-visual Speech Enhancement},
  author = {Mostafa Sadeghi and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:1912.10647},
  year   = {2021}
}

备注

IEEE Transactions on Signal Processing