中文

用于多样自然非自回归语音合成的分层多尺度变分自编码器

音频与语音处理 2022-08-16 v2 声音

摘要

本文提出一种基于分层多尺度变分自编码器的非自回归语音合成模型(HiMuV-TTS),以生成具有多样说话风格的自然语音。近期非自回归 TTS(NAR-TTS)模型的进展显著提升了合成语音的推理速度与鲁棒性。然而,其说话风格多样性与自然度仍有待提升。为解决该问题,我们提出 HiMuV-TTS 模型,其先确定全局尺度韵律,再在全局尺度韵律与所学文本表示的条件下确定局部尺度韵律。此外,我们采用对抗训练技术改善语音质量。实验结果验证,与采用单尺度变分自编码器的 TTS 模型相比,所提 HiMuV-TTS 模型能生成更具多样性与自然度的语音,并能在各尺度表征不同的韵律信息。

关键词

引用

@article{arxiv.2204.04004,
  title  = {Hierarchical and Multi-Scale Variational Autoencoder for Diverse and Natural Non-Autoregressive Text-to-Speech},
  author = {Jae-Sung Bae and Jinhyeok Yang and Tae-Jun Bak and Young-Sun Joo},
  journal= {arXiv preprint arXiv:2204.04004},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022