中文

变分自编码器与空间聚类融合用于自适应多通道神经语音分离

音频与语音处理 2020-11-25 v1

摘要

本文提出一种将语音的变分自编码器模型与空间聚类方法相结合的多通道语音分离方法。若干工作已表明将空间聚类与谱模型相融合的优势。作为谱模型,先前工作或使用混合语音的因子生成模型,或使用判别性神经网络。本工作中,我们基于生成式神经网络(变分自编码器)构建因子模型,从而结合了两种方法的优势。如此,我们既能利用神经网络的建模能力,又可保持结构化模型。该模型在适应新噪声条件时具有优势,因仅需修改模型的噪声部分。我们通过实验表明,我们的模型显著优于先前基于高斯混合模型的因子模型(DOLPHIN),与置换不变训练与空间聚类相融合的方法性能相当,且能轻松适应新噪声条件。方法代码见 https://github.com/BUTSpeechFIT/vae_dolphin

关键词

引用

@article{arxiv.2011.11984,
  title  = {Integration of variational autoencoder and spatial clustering for adaptive multi-channel neural speech separation},
  author = {Katerina Zmolikova and Marc Delcroix and Lukáš Burget and Tomohiro Nakatani and Jan "Honza" Černocký},
  journal= {arXiv preprint arXiv:2011.11984},
  year   = {2020}
}

备注

8 pages, 3 figures, to be published in SLT2021