Glow-TTS:一种通过单调对齐搜索进行文本到语音生成的生成流
音频与语音处理
2020-10-26 v2 声音
摘要
最近,诸如 FastSpeech 和 ParaNet 等文本到语音(TTS)模型被提出,用于并行地从文本生成梅尔频谱图。尽管具有优势,但并行 TTS 模型在没有自回归 TTS 模型作为其外部对齐器的指导下无法训练。在这项工作中,我们提出了 Glow-TTS,一种基于流的生成模型,用于并行 TTS,无需任何外部对齐器。通过结合流的属性和动态规划,所提出的模型自行搜索文本与语音潜在表示之间最可能的单调对齐。我们证明,强制执行硬单调对齐能够实现鲁棒的 TTS,可泛化到长语句,而采用生成流则能够实现快速、多样且可控的语音合成。Glow-TTS 在合成速度上比自回归模型 Tacotron 2 快了一个数量级,且语音质量相当。我们进一步表明,我们的模型可以轻松扩展到多说话人设置。
引用
@article{arxiv.2005.11129,
title = {Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search},
author = {Jaehyeon Kim and Sungwon Kim and Jungil Kong and Sungroh Yoon},
journal= {arXiv preprint arXiv:2005.11129},
year = {2020}
}
备注
Accepted by NeurIPS2020