中文

基于深度动态生成语音与噪声模型的无监督语音增强

音频与语音处理 2023-06-14 v1 机器学习 声音

摘要

本工作建立在先前关于无监督语音增强的研究之上,该研究中采用动态变分自编码器(DVAE)作为干净语音模型、非负矩阵分解(NMF)作为噪声模型。我们提出以深度动态生成模型(DDGM)替代 NMF 噪声模型,该 DDGM 依赖于 DVAE 潜变量、带噪观测或二者兼具。此 DDGM 可按三种配置训练:噪声无关、噪声相关以及噪声相关训练后的噪声自适应。实验结果表明,所提方法相较于最先进的无监督语音增强方法取得了有竞争力的性能,而噪声相关训练配置带来了时效性高得多的推理过程。

关键词

引用

@article{arxiv.2306.07820,
  title  = {Unsupervised speech enhancement with deep dynamical generative speech and noise models},
  author = {Xiaoyu Lin and Simon Leglaive and Laurent Girin and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2306.07820},
  year   = {2023}
}