中文

基于双向编码器表示的日语文本语音合成中的短语断句预测

音频与语音处理 2021-04-27 v1 计算与语言 机器学习

摘要

我们提出了一种新颖的短语断句预测方法,该方法结合了从预训练大语言模型(即 BERT)提取的隐式特征,以及从带有语言特征的 BiLSTM 提取的显式特征。在传统的基于 BiLSTM 的方法中,词表示和/或句表示被用作独立组件。所提方法同时考虑两种表示以提取潜在语义,这是以往方法无法捕捉的。客观评估结果表明,与基于 BiLSTM 的使用语言特征的常规方法相比,所提方法的 F1 分数绝对提升了 3.2 个点。此外,感知听测结果验证,应用我们所提方法的 TTS 系统在韵律自然度上获得了 4.39 的平均意见分,与具有真实短语断句的合成语音得分 4.37 极具竞争力。

关键词

引用

@article{arxiv.2104.12395,
  title  = {Phrase break prediction with bidirectional encoder representations in Japanese text-to-speech synthesis},
  author = {Kosuke Futamata and Byeongseon Park and Ryuichi Yamamoto and Kentaro Tachibana},
  journal= {arXiv preprint arXiv:2104.12395},
  year   = {2021}
}

备注

Submitted to INTERSPEECH 2021