用于语音表示学习的离散潜变量模型比较
音频与语音处理
2020-10-28 v1 人工智能
机器学习
声音
摘要
神经潜变量模型能够发现语音音频数据中有趣的结构。本文比较了两种基于预测未来时间步或自编码输入信号的不同方法。我们的研究从子词单元发现和音素识别性能两方面比较了 vq-vae 和 vq-wav2vec 学习到的表示。结果表明,使用 vq-wav2vec 进行未来时间步预测取得了更好的性能。最佳系统在 ZeroSpeech 2019 ABX 音素判别挑战上达到了 13.22 的错误率。
引用
@article{arxiv.2010.14230,
title = {A Comparison of Discrete Latent Variable Models for Speech Representation Learning},
author = {Henry Zhou and Alexei Baevski and Michael Auli},
journal= {arXiv preprint arXiv:2010.14230},
year = {2020}
}
备注
7 pages, 4 figures