利用语言信息与噪声数据改善语音合成中对未见文本的韵律
计算与语言
2021-11-16 v1 声音
音频与语音处理
摘要
端到端语音合成的最新进展已使得生成高度自然的语音成为可能。然而,训练这些模型通常需要大量高保真语音数据,且对于未见文本,合成语音的韵律相对不自然。为解决这些问题,我们提出将微调的基于 BERT 的前端与前训练的基于 FastSpeech2 的声学模型相结合以改善韵律建模。预训练的 BERT 在多任务学习框架下于多音字消歧任务、中文分词(CWS)与词性标注(POS)联合任务以及韵律结构预测(PSP)任务上进行微调。FastSpeech 2 在大规模外部噪声数据上预训练,此类数据噪声较大但更易获取。实验结果表明,微调的 BERT 模型与前训练的 FastSpeech 2 均能改善韵律,尤其对于结构复杂的句子。
引用
@article{arxiv.2111.07549,
title = {Improving Prosody for Unseen Texts in Speech Synthesis by Utilizing Linguistic Information and Noisy Data},
author = {Zhu Li and Yuqing Zhang and Mengxi Nie and Ming Yan and Mengnan He and Ruixiong Zhang and Caixia Gong},
journal= {arXiv preprint arXiv:2111.07549},
year = {2021}
}