中文

基于深度高斯过程并使用简单循环单元的语句级序列建模语音合成

音频与语音处理 2020-04-24 v1 机器学习 声音 机器学习

摘要

本文提出一种具有循环架构的深度高斯过程(DGP)模型用于语音序列建模。DGP 是一种贝叶斯深度模型,可在考虑模型复杂度的前提下有效训练,并且是一种具有高表达能力的核回归模型。先前研究表明,基于 DGP 的语音合成优于基于神经网络的合成,两者均使用前馈架构。为提升合成语音的自然度,本文中我们展示 DGP 可利用循环架构模型应用于语句级建模。我们为所提模型采用简单循环单元(SRU)以实现循环架构,其中可借助 SRU 的高并行性实现快速语音参数生成。客观与主观评测结果表明,所提基于 SRU-DGP 的语音合成不仅优于前馈 DGP,也优于自动调优的基于 SRU 和长短期记忆(LSTM)的神经网络。

关键词

引用

@article{arxiv.2004.10823,
  title  = {Utterance-level Sequential Modeling For Deep Gaussian Process Based Speech Synthesis Using Simple Recurrent Unit},
  author = {Tomoki Koriyama and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2004.10823},
  year   = {2020}
}

备注

5 pages. Accepted by ICASSP2020