DeepZen用于Blizzard Challenge 2023的语音合成系统
音频与语音处理
2023-09-04 v2 声音
摘要
本文描述了DeepZen用于Blizzard Challenge 2023的文本转语音(TTS)系统。该挑战的目标是从大型单说话人数据集(hub任务)以及通过说话人自适应从小型数据集(spoke任务)合成自然且高质量的法语语音。我们以相同模型架构参与了两项任务。我们的方法采用自回归模型,其在生成自然 sounding 语音方面保有优势,但通过若干方式改进了韵律控制。类似于非注意力Tacotron,模型在推理时使用时长预测器与高斯上采样,但采用更简单的无监督训练。我们还通过从参考语音提取全局与局部风格令牌,在句子与词级别对说话风格建模。在推理时,全局与局部风格令牌由基于文本运行的BERT模型预测。该BERT模型亦用于预测特定发音特征,如弱化元音省略与可选联诵。最后,使用在大型公开数据集上训练并针对目标嗓音微调的改进版HifiGAN生成语音波形。我们的团队在Blizzard评估中标识为O,MUSHRA测试结果显示,在分别18与14名参与者中,我们的系统在hub任务(中位数得分0.75)与spoke任务(中位数得分0.68)均并列第二。
引用
@article{arxiv.2308.15945,
title = {The DeepZen Speech Synthesis System for Blizzard Challenge 2023},
author = {Christophe Veaux and Ranniery Maia and Spyridoula Papandreou},
journal= {arXiv preprint arXiv:2308.15945},
year = {2023}
}
备注
Blizzard Challenge 2023