中文

JETS:联合训练 FastSpeech2 与 HiFi-GAN 的端到端语音合成

音频与语音处理 2022-07-05 v2 机器学习 声音

摘要

在神经文本到语音(TTS)中,两阶段系统或级联的分别学习模型已展现出接近人类语音的合成质量。例如,FastSpeech2 将输入文本转换为梅尔频谱图,然后 HiFi-GAN 从梅尔频谱图生成原始波形,它们分别被称为声学特征生成器和神经声码器。然而,它们的训练流程有些繁琐,因为需要微调以及精确的语音-文本对齐以获得最优性能。在本工作中,我们提出一种端到端文本到语音(E2E-TTS)模型,其具有简化的训练流程,并且优于级联的分别学习模型。具体而言,我们提出的模型通过对齐模块联合训练 FastSpeech2 和 HiFi-GAN。由于训练和推理之间不存在声学特征失配,因此不需要微调。此外,我们通过在联合训练框架中采用对齐学习目标,去除了对外部语音-文本对齐工具的依赖。在 LJSpeech 语料库上的实验表明,所提模型在主观评价(MOS)和一些客观评价上优于 ESPNet2-TTS 公开可用的、最先进的实现。

关键词

引用

@article{arxiv.2203.16852,
  title  = {JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to Speech},
  author = {Dan Lim and Sunghee Jung and Eesung Kim},
  journal= {arXiv preprint arXiv:2203.16852},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022