中文

利用语言信息与噪声数据改善语音合成中对未见文本的韵律

计算与语言 2021-11-16 v1 声音 音频与语音处理

摘要

端到端语音合成的最新进展已使得生成高度自然的语音成为可能。然而,训练这些模型通常需要大量高保真语音数据,且对于未见文本,合成语音的韵律相对不自然。为解决这些问题,我们提出将微调的基于 BERT 的前端与前训练的基于 FastSpeech2 的声学模型相结合以改善韵律建模。预训练的 BERT 在多任务学习框架下于多音字消歧任务、中文分词(CWS)与词性标注(POS)联合任务以及韵律结构预测(PSP)任务上进行微调。FastSpeech 2 在大规模外部噪声数据上预训练,此类数据噪声较大但更易获取。实验结果表明,微调的 BERT 模型与前训练的 FastSpeech 2 均能改善韵律,尤其对于结构复杂的句子。

关键词

引用

@article{arxiv.2111.07549,
  title  = {Improving Prosody for Unseen Texts in Speech Synthesis by Utilizing Linguistic Information and Noisy Data},
  author = {Zhu Li and Yuqing Zhang and Mengxi Nie and Ming Yan and Mengnan He and Ruixiong Zhang and Caixia Gong},
  journal= {arXiv preprint arXiv:2111.07549},
  year   = {2021}
}