基于大预训练语言模型伪前瞻的增量文本到语音合成
声音
2021-05-26 v2 音频与语音处理
摘要
本文提出一种增量文本到语音(TTS)方法,以小语言单元进行合成,同时保持输出语音的自然度。增量TTS通常面临延迟与合成语音质量之间的权衡。在低延迟设置下(即不大程度利用未观测到的未来句子,以下称“前瞻”)产出高质量语音具有挑战性。为解决此问题,我们提出一种增量TTS方法,利用语言模型生成的伪前瞻来考量未来上下文信息而不增加延迟。我们的方法可视为模仿人类的增量阅读,并使用预训练的GPT2(其具备大规模语言知识)进行前瞻生成。评估结果表明,我们的方法1)比仅考虑已观测信息的方法实现更高语音质量,且2)实现了等同于等待未来上下文观测的语音质量。
引用
@article{arxiv.2012.12612,
title = {Incremental Text-to-Speech Synthesis Using Pseudo Lookahead with Large Pretrained Language Model},
author = {Takaaki Saeki and Shinnosuke Takamichi and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2012.12612},
year = {2021}
}
备注
Accepted for IEEE Signal Processing Letters