中文

JDI-T:无需显式对齐、联合训练时长感知 Transformer 的文本转语音模型

音频与语音处理 2020-10-06 v3 计算与语言 机器学习 声音

摘要

我们提出联合训练时长感知 Transformer(Jointly trained Duration Informed Transformer,JDI-T),一种带有时长预测器的前馈 Transformer,在无显式对齐的情况下联合训练,以从输入文本生成声学特征序列。本工作中,受 FastSpeech 和 DurIAN 等时长感知网络近期成功的启发,我们将其顺序的两阶段训练流程进一步简化为单阶段训练。具体而言,我们在联合训练期间动态地从自回归 Transformer 提取音素时长,而非预训练自回归模型并将其用作音素时长提取器。据我们所知,这是在单一训练流程中无需依赖预训练音素时长提取器来联合训练前馈 Transformer 的首个实现。我们在公开可用的韩文单说话人语音(KSS)数据集上评估了所提模型的有效性,并与由 ESPnet-TTS 训练的基线文本转语音(TTS)模型进行比较。

关键词

引用

@article{arxiv.2005.07799,
  title  = {JDI-T: Jointly trained Duration Informed Transformer for Text-To-Speech without Explicit Alignment},
  author = {Dan Lim and Won Jang and Gyeonghwan O and Heayoung Park and Bongwan Kim and Jaesam Yoon},
  journal= {arXiv preprint arXiv:2005.07799},
  year   = {2020}
}

备注

Accepted for publication in Interspeech 2020