中文

基于深度学习的端到端语音合成技术综述

声音 2021-04-21 v1 计算与语言 音频与语音处理

摘要

作为现代人机交互系统不可或缺的一部分,语音合成技术帮助用户更轻松直观地获取智能机器的输出,因此受到越来越多的关注。由于传统语音合成技术复杂度高、效率低等局限,当前研究焦点是基于深度学习的端到端语音合成技术,其具有更强的建模能力和更简洁的流程。它主要由文本前端、声学模型和声码器三个模块组成。本文综述了这三部分的研究现状,并根据其侧重点对各种方法进行分类与比较。此外,本文还总结了可用于语音合成任务的英语、中文及其他语言的开源语音语料库,并介绍了一些常用的主观与客观语音质量评价方法。最后,指出了若干值得关注的未来研究方向。

关键词

引用

@article{arxiv.2104.09995,
  title  = {Review of end-to-end speech synthesis technology based on deep learning},
  author = {Zhaoxi Mu and Xinyu Yang and Yizhuo Dong},
  journal= {arXiv preprint arXiv:2104.09995},
  year   = {2021}
}