中文

ZeroSpeech 2020 挑战赛中用于声学单元发现的向量量化神经网络

音频与语音处理 2020-08-20 v2 计算与语言

摘要

在本文中,我们探索向量量化用于声学单元发现。借助无标签数据,我们旨在学习语音的离散表示,将音素内容与会话者特定细节分离。我们提出两个神经网络模型应对该挑战——二者均使用向量量化将连续特征映射到有限码集。第一个模型是一类向量量化变分自编码器(VQ-VAE)。VQ-VAE 将语音编码为离散单元序列,再重建音频波形。我们的第二个模型将向量量化与对比预测编码结合(VQ-CPC)。其思想是通过预测未来声学单元来学习语音表示。我们在 ZeroSpeech 2020 挑战赛的英语与印尼语数据上评估模型。在 ABX 音素判别测试中,两个模型均优于 2019 与 2020 挑战赛的所有提交,相对提升超 30%。这些模型在下游语音转换任务上也具竞争力。二者中,VQ-CPC 总体略优且更简更快训练。最后,探测实验表明向量量化是有效瓶颈,迫使模型丢弃说话人信息。

关键词

引用

@article{arxiv.2005.09409,
  title  = {Vector-quantized neural networks for acoustic unit discovery in the ZeroSpeech 2020 challenge},
  author = {Benjamin van Niekerk and Leanne Nortje and Herman Kamper},
  journal= {arXiv preprint arXiv:2005.09409},
  year   = {2020}
}

备注

5 pages, 3 figures, 2 tables, accepted to Interspeech 2020