中文

基于预训练语言模型的时长感知多说话人语音合成停顿插入

音频与语音处理 2023-02-28 v1 计算与语言 机器学习 声音

摘要

停顿插入(亦称短语断句预测与短语划分)是 TTS 系统的重要组成部分,因为具有自然时长的恰当停顿能显著提升合成语音的节奏与可懂度。然而,传统断句模型忽略了多说话人在插入静音停顿上的不同风格,这会劣化基于多说话人语音语料库训练的模型性能。为此,我们提出基于预训练语言模型的更强大停顿插入框架。我们的方法使用在大规模文本语料上预训练的双向编码器表示来自变换器(BERT),并注入说话人嵌入以捕捉不同说话人特征。我们还利用时长感知停顿插入实现更自然的多说话人 TTS。我们开发并评估了两类模型。第一类改进了传统断句模型在呼吸停顿(RPs,即无标点词过渡处的静音停顿)位置预测上的表现,它执行考虑上下文信息的说话人条件 RP 预测,并用于展示说话人信息对预测的影响。第二类模型进一步为基于音素的 TTS 模型设计,执行时长感知停顿插入,预测按时长分类的 RPs 与标点指示停顿(PIPs)。评估结果显示,我们的模型提升了停顿插入的精确率、召回率及合成语音的节奏感。

关键词

引用

@article{arxiv.2302.13652,
  title  = {Duration-aware pause insertion using pre-trained language model for multi-speaker text-to-speech},
  author = {Dong Yang and Tomoki Koriyama and Yuki Saito and Takaaki Saeki and Detai Xin and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2302.13652},
  year   = {2023}
}

备注

Accepted by ICASSP2023