中文

动态变分自编码器在语音谱图建模上的基准测试

声音 2021-06-15 v2 音频与语音处理

摘要

变分自编码器(VAE)是一种强大的深度生成模型,现广泛用于通过无监督方式学习的低维潜空间来表示高维复杂数据。在原始VAE模型中,输入数据向量被独立处理。近年来,一系列论文提出了VAE的不同扩展以处理序列数据,其不仅建模潜空间,还借助循环神经网络建模数据向量序列及相应潜向量内的时间依赖关系。我们近期对这些模型进行了全面综述,并将它们统一为一个称为动态变分自编码器(DVAE)的通用类别。在本文中,我们给出了一个实验基准测试的结果,该测试在语音分析-重合成任务上比较了其中六种DVAE模型,以说明DVAE在语音建模方面的巨大潜力。

关键词

引用

@article{arxiv.2106.06500,
  title  = {A Benchmark of Dynamical Variational Autoencoders applied to Speech Spectrogram Modeling},
  author = {Xiaoyu Bie and Laurent Girin and Simon Leglaive and Thomas Hueber and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2106.06500},
  year   = {2021}
}

备注

Accepted to Interspeech 2021. arXiv admin note: text overlap with arXiv:2008.12595