中文

NaturalSpeech:具备人类水平质量的端到端文本到语音合成

音频与语音处理 2022-05-11 v2 人工智能 计算与语言 机器学习 声音

摘要

近年来,文本到语音(TTS)在学术界与工业界均取得快速进展。一些自然产生的问题包括:TTS 系统能否达到人类水平质量、如何定义/评判该质量以及如何实现。在本文中,我们首先基于主观度量的统计显著性定义人类水平质量并引入恰当的准则来评判它,继而开发名为 NaturalSpeech 的 TTS 系统,在基准数据集上达到人类水平质量,从而回答这些问题。具体而言,我们利用变分自编码器(VAE)进行端到端文本到波形生成,并借助若干关键模块增强来自文本的先验能力并降低来自语音的后验复杂度,包括音素预训练、可微时长建模、双向先验/后验建模以及 VAE 中的记忆机制。在流行的 LJSpeech 数据集上的实验评估表明,我们提出的 NaturalSpeech 在句子级别达到相对于人类录音 -0.01 CMOS(比较平均意见分),Wilcoxon 符号秩检验 p 值 p >> 0.05,这首次在该数据集上证明与人类录音无统计显著差异。

关键词

引用

@article{arxiv.2205.04421,
  title  = {NaturalSpeech: End-to-End Text to Speech Synthesis with Human-Level Quality},
  author = {Xu Tan and Jiawei Chen and Haohe Liu and Jian Cong and Chen Zhang and Yanqing Liu and Xi Wang and Yichong Leng and Yuanhao Yi and Lei He and Frank Soong and Tao Qin and Sheng Zhao and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2205.04421},
  year   = {2022}
}

备注

19 pages, 3 figures, 8 tables