基于离散潜变量神经网络的无监督语音合成声学单元发现
计算与语言
2019-07-01 v2 机器学习
声音
音频与语音处理
摘要
在我们提交给 ZeroSpeech 2019 挑战赛的工作中,我们将离散潜变量神经网络应用于无标注语音,并利用所发现的单元进行语音合成。无监督离散子词建模可用于婴儿语音范畴学习研究,或需要符号输入的低资源语音技术。我们采用具有中间离散化的自编码器(AE)架构。我们通过将 AE 的解码器在训练说话人身份上进行条件化,将声学单元发现与说话人建模解耦。在测试时,对来自未见说话人的语音进行单元发现,随后在已知目标说话人条件下进行单元解码,以获得重构的滤波器组。该输出被送入神经声码器,以合成目标说话人音色的语音。对于离散化,我们在两种语言上比较了不同压缩级别下的类别变分自编码器(CatVAE)、矢量量化 VAE(VQ-VAE)和直通估计。我们的最终模型使用卷积编码、VQ-VAE 离散化、反卷积解码和 FFTNet 声码器。我们表明,解耦的说话人条件化本质上改善了离散声学表示,相较于挑战赛基线取得了有竞争力的合成质量。
引用
@article{arxiv.1904.07556,
title = {Unsupervised acoustic unit discovery for speech synthesis using discrete latent-variable neural networks},
author = {Ryan Eloff and André Nortje and Benjamin van Niekerk and Avashna Govender and Leanne Nortje and Arnu Pretorius and Elan van Biljon and Ewald van der Westhuizen and Lisa van Staden and Herman Kamper},
journal= {arXiv preprint arXiv:1904.07556},
year = {2019}
}
备注
Interspeech 2019