中文

使用动态变分自编码器的无监督语音增强

声音 2022-10-04 v3 人工智能 机器学习 音频与语音处理

摘要

动态变分自编码器(DVAE)是一类带有潜变量的深度生成模型,专门用于建模高维数据的时间序列。DVAE可视为变分自编码器(VAE)的扩展,其包含了连续观测向量和/或潜向量之间的时间依赖关系。先前的工作已表明在语音谱图建模中使用DVAE优于VAE。独立地,VAE已成功应用于噪声中的语音增强,采用一种无监督的与噪声无关的设置,该设置训练时既不需要噪声样本也不需要带噪语音样本,而仅需干净语音信号。在本文中,我们将这些工作扩展到基于DVAE的单通道无监督语音增强,从而同时利用语音信号的无监督表示学习和动态建模。我们提出一种无监督语音增强算法,将先在干净语音信号上预训练的DVAE语音先验与基于非负矩阵分解的噪声模型相结合,并推导出一种变分期望最大化(VEM)算法来执行语音增强。该算法以最一般的DVAE公式给出,随后使用三种具体的DVAE模型进行应用,以说明该框架的通用性。实验结果表明,所提出的基于DVAE的方法优于其基于VAE的对应方法,以及多种有监督和无监督的依赖于噪声的基线,尤其在训练时未见过的噪声类型下。

关键词

引用

@article{arxiv.2106.12271,
  title  = {Unsupervised Speech Enhancement using Dynamical Variational Auto-Encoders},
  author = {Xiaoyu Bie and Simon Leglaive and Xavier Alameda-Pineda and Laurent Girin},
  journal= {arXiv preprint arXiv:2106.12271},
  year   = {2022}
}