利用跨语句BERT嵌入改进端到端语音合成中的韵律建模
音频与语音处理
2020-11-11 v1 机器学习
声音
摘要
尽管韵律与直至语篇结构的语言信息相关,大多数文本转语音(TTS)系统仅考虑句内信息,这使得将一段文本转换为自然且富有表现力的语音颇具挑战。本文提出以端到端方式利用邻句文本嵌入改进段落中每句话的韵律生成,且不使用任何显式韵律特征。具体而言,由额外跨语句(CU)编码器基于预训练BERT模型提取的句子嵌入所产生的CU上下文向量,用于增强Tacotron2解码器的输入。我们探究了两类BERT嵌入,并据此采用不同的CU编码器结构。在普通话有声书数据集与LJ-Speech英语有声书数据集上的实验结果表明,使用CU信息可提升合成语音的自然度与表现力。主观听测显示多数受试者偏好CU编码器生成的语音而非标准Tacotron2生成者。研究还发现可通过改变邻句间接控制韵律。
引用
@article{arxiv.2011.05161,
title = {Improving Prosody Modelling with Cross-Utterance BERT Embeddings for End-to-end Speech Synthesis},
author = {Guanghui Xu and Wei Song and Zhengchen Zhang and Chao Zhang and Xiaodong He and Bowen Zhou},
journal= {arXiv preprint arXiv:2011.05161},
year = {2020}
}
备注
5 pages, 4 figures