基于字素预测的音素级 BERT 以增强文本转语音的韵律
计算与语言
2023-01-24 v1 声音
音频与语音处理
摘要
大规模预训练语言模型已被证明可通过使文本转语音(TTS)模型产生更自然的韵律模式来提升其自然度。然而,这些模型通常为词级或亚音素级,并与音素联合训练,对于仅需音素的下游 TTS 任务而言效率低下。在本工作中,我们提出了一种音素级 BERT(PL-BERT),其前置任务为预测相应字素以及常规的掩码音素预测。主观评价表明,与最先进的(SOTA)StyleTTS 基线相比,我们的音素级 BERT 编码器显著提升了分布外(OOD)文本上合成语音自然度的平均意见分(MOS)。
引用
@article{arxiv.2301.08810,
title = {Phoneme-Level BERT for Enhanced Prosody of Text-to-Speech with Grapheme Predictions},
author = {Yinghao Aaron Li and Cong Han and Xilin Jiang and Nima Mesgarani},
journal= {arXiv preprint arXiv:2301.08810},
year = {2023}
}