中文

端到端语音合成中鲁棒且细粒度的韵律控制

计算与语言 2019-02-19 v2 机器学习 声音 音频与语音处理

摘要

我们提出了用于情感和表现力语音合成网络的韵律嵌入。所提出的方法在嵌入网络中引入时间结构,从而实现对合成语音说话风格的细粒度控制。时间结构可设计在语音侧或文本侧,从而在时间上产生不同的控制分辨率。韵律嵌入网络被插入端到端语音合成网络中,除目标合成语音外无需任何其他监督进行训练。结果表明,韵律嵌入网络学会了提取韵律特征。通过调整学习到的韵律特征,我们可以在帧级和音素级改变合成语音的音高和振幅。我们还引入了韵律嵌入的时间归一化,其在韵律迁移任务中针对说话人扰动表现出更好的鲁棒性。

关键词

引用

@article{arxiv.1811.02122,
  title  = {Robust and fine-grained prosody control of end-to-end speech synthesis},
  author = {Younggun Lee and Taesu Kim},
  journal= {arXiv preprint arXiv:1811.02122},
  year   = {2019}
}

备注

ICASSP 2019, best viewed in color