中文

风格令牌:端到端语音合成中的无监督风格建模、控制与迁移

计算与语言 2018-03-28 v1 机器学习 声音 音频与语音处理

摘要

在这项工作中,我们提出了“全局风格令牌”(GSTs),这是一个在先进的端到端语音合成系统 Tacotron 内联合训练的嵌入库。这些嵌入在没有显式标签的情况下进行训练,却能学习建模大范围的声学表现力。GSTs 带来了大量重要的结果。它们生成的软性可解释“标签”可用于以新颖的方式控制合成,例如独立于文本内容改变语速和说话风格。它们还可用于风格迁移,将单个音频片段的说话风格复制到整个长文本语料库中。当在含噪、无标注的发现数据上训练时,GSTs 能够解耦噪声与说话人身份,为实现高度可扩展且鲁棒的语音合成提供了一条路径。

关键词

引用

@article{arxiv.1803.09017,
  title  = {Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis},
  author = {Yuxuan Wang and Daisy Stanton and Yu Zhang and RJ Skerry-Ryan and Eric Battenberg and Joel Shor and Ying Xiao and Fei Ren and Ye Jia and Rif A. Saurous},
  journal= {arXiv preprint arXiv:1803.09017},
  year   = {2018}
}