中文

用于语音解耦表示无监督学习的对比预测编码增强因子化变分自编码器

音频与语音处理 2021-03-12 v2 声音

摘要

在本工作中,我们处理语音信号中风格与内容的解耦问题。我们提出一种全卷积变分自编码器,采用两个编码器:内容编码器与风格编码器。为促进解耦,我们提出对抗式对比预测编码。这一新解耦方法既不需要平行数据,也不需要任何监督。我们表明,所提技术能够将说话人与内容特征分离到两种不同的表示中,并展现出与其他无监督方法相比具有竞争力的说话人-内容解耦性能。我们进一步证明,当用于音素识别时,内容表示相对于频谱特征在训练-测试失配下具有更强的鲁棒性。

关键词

引用

@article{arxiv.2005.12963,
  title  = {Contrastive Predictive Coding Supported Factorized Variational Autoencoder for Unsupervised Learning of Disentangled Speech Representations},
  author = {Janek Ebbers and Michael Kuhlmann and Tobias Cord-Landwehr and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2005.12963},
  year   = {2021}
}

备注

accepted by icassp 2021