中文

Flavored Tacotron:用于韵律-语言特征的 conditioned 学习

声音 2021-04-12 v1 计算与语言 机器学习

摘要

神经序列到序列文本到语音合成(TTS),如 Tacotron-2,将文本转换为高质量语音。然而,生成具有自然韵律的语音仍然是一个挑战。Yasuda 等人表明,与自然语音不同,Tacotron-2 的编码器不能从字符中充分表示韵律特征(例如英语中的音节重音),并导致平坦的基频变化。在这项工作中,我们提出了一种新颖的精心设计的策略,用于以英语中两个基本韵律特征——重音音节和音高重音——为条件训练 Tacotron-2,从而帮助实现更自然的韵律。为此,我们使用一个分类器以端到端方式学习这些特征,并在 Tacotron-2 的文本到梅尔谱图的三个部分应用特征条件化:编码器前、编码器后和解码器内部。此外,我们表明在编码器前和解码器内部阶段联合条件化特征可产生韵律自然的合成语音(对比 Tacotron-2),并允许模型生成具有更准确音高重音和重音模式的语音。定量评估表明,我们的公式实现了更高的基频轮廓相关性,以及合成语音与自然语音之间更低的梅尔倒谱失真度量。主观评估显示,所提方法的平均意见得分为 4.14,高于基线 Tacotron-2 的 3.91,而自然语音(LJSpeech 语料库)为 4.28。

关键词

引用

@article{arxiv.2104.04050,
  title  = {Flavored Tacotron: Conditional Learning for Prosodic-linguistic Features},
  author = {Mahsa Elyasi and Gaurav Bharaj},
  journal= {arXiv preprint arXiv:2104.04050},
  year   = {2021}
}

备注

5