用于 ZeroSpeech Challenge 2019 的 VQVAE 无监督单元发现与多尺度 Code2Spec 逆变换器
计算与语言
2019-05-30 v2 机器学习
声音
音频与语音处理
摘要
我们描述了为 ZeroSpeech Challenge 2019 提交的系统的系统。当前挑战主题涉及在无任何文本或音素标签条件下构建语音合成器的困难,并要求系统能够(1)以无监督方式发现子词单元,以及(2)以目标说话人声音合成语音。此外,系统还应平衡 ABX 区分度得分、比特率压缩率,以及所构建语音的自然度与可懂度。为应对这些问题并取得最佳权衡,我们采用了向量量化变分自编码器(VQ-VAE)和由均方误差与对抗损失训练的多尺度码本到谱图(Code2Spec)逆变换器。VQ-VAE 将语音提取至潜空间,迫使自身将其映射至最近的码本并产生压缩表示。接着,给定来自 VQ-VAE 的码本向量,逆变换器生成目标声音的幅度谱图。在我们的实验中,我们还研究了其他几种聚类算法,包括 K-Means 和 GMM,并在 ABX 得分与比特率上将它与 VQ-VAE 结果进行比较。相较于官方 ZeroSpeech 2019 基线甚至 topline,我们提出的方法显著改善了可懂度(以 CER 计)、MOS 以及 ABX 区分度得分。
引用
@article{arxiv.1905.11449,
title = {VQVAE Unsupervised Unit Discovery and Multi-scale Code2Spec Inverter for Zerospeech Challenge 2019},
author = {Andros Tjandra and Berrak Sisman and Mingyang Zhang and Sakriani Sakti and Haizhou Li and Satoshi Nakamura},
journal= {arXiv preprint arXiv:1905.11449},
year = {2019}
}
备注
Submitted to Interspeech 2019