中文

用于语音表示学习的离散潜变量模型比较

音频与语音处理 2020-10-28 v1 人工智能 机器学习 声音

摘要

神经潜变量模型能够发现语音音频数据中有趣的结构。本文比较了两种基于预测未来时间步或自编码输入信号的不同方法。我们的研究从子词单元发现和音素识别性能两方面比较了 vq-vae 和 vq-wav2vec 学习到的表示。结果表明,使用 vq-wav2vec 进行未来时间步预测取得了更好的性能。最佳系统在 ZeroSpeech 2019 ABX 音素判别挑战上达到了 13.22 的错误率。

关键词

引用

@article{arxiv.2010.14230,
  title  = {A Comparison of Discrete Latent Variable Models for Speech Representation Learning},
  author = {Henry Zhou and Alexei Baevski and Michael Auli},
  journal= {arXiv preprint arXiv:2010.14230},
  year   = {2020}
}

备注

7 pages, 4 figures