中文

可扩展的因子化层次变分自编码器训练

机器学习 2018-06-18 v2 计算与语言 机器学习 声音 音频与语音处理

摘要

深度生成模型在无监督学习中取得了巨大成功,能够捕捉潜在生成因子与观测之间复杂的非线性关系。其中,因子化层次变分自编码器(FHVAE)是一种基于变分推断的模型,为序列数据制定了层次生成过程。具体而言,FHVAE模型可学习解耦且可解释的表示,已被证明对众多语音应用有用,如说话人验证、鲁棒语音识别和语音转换。然而,正如我们将在本文中详述的,原论文提出的训练算法无法扩展到数千小时的数据集,这使得该模型在更大规模上适用性较低。在明确了运行时、内存和超参数优化方面的局限性后,我们提出了一种层次采样训练算法来解决这三个问题。我们提出的方法在从3到1000小时、涉及不同类型生成因子(如录制条件和噪声类型)的广泛数据集上进行了全面评估。此外,我们还提出了一种新的可视化方法,用于定性评估可解释性与解耦方面的性能。使用我们提出算法训练的模型在所有数据集上均展现出期望的特性。

关键词

引用

@article{arxiv.1804.03201,
  title  = {Scalable Factorized Hierarchical Variational Autoencoder Training},
  author = {Wei-Ning Hsu and James Glass},
  journal= {arXiv preprint arXiv:1804.03201},
  year   = {2018}
}

备注

Interspeech 2018