中文

揭示表达性语音合成中的潜在风格因子

计算与语言 2017-11-03 v1 声音

摘要

韵律建模是语音合成中的核心问题。关键挑战是从仅含音素信息的文本输入生成理想的韵律。在这项初步研究中,我们在Tacotron(一种近期提出的端到端神经语音合成模型)中引入“风格令牌”的概念。利用风格令牌,我们旨在从训练数据中提取独立的韵律风格。我们表明,在没有标注数据或显式监督信号的情况下,我们的方法能以纯粹数据驱动的方式自动学习多种韵律变化。重要的是,每个风格令牌对应于一个固定的风格因子,而与给定文本序列无关。因此,我们能以某种可预测且全局一致的方式控制合成语音的韵律风格。

关键词

引用

@article{arxiv.1711.00520,
  title  = {Uncovering Latent Style Factors for Expressive Speech Synthesis},
  author = {Yuxuan Wang and RJ Skerry-Ryan and Ying Xiao and Daisy Stanton and Joel Shor and Eric Battenberg and Rob Clark and Rif A. Saurous},
  journal= {arXiv preprint arXiv:1711.00520},
  year   = {2017}
}

备注

Submitted to NIPS ML4Audio workshop and ICASSP