AlignTTS:无需显式对齐的高效前馈文本到语音系统
音频与语音处理
2020-03-05 v1 计算与语言
声音
摘要
为兼顾高效率与高性能,我们提出 AlignTTS 以并行预测梅尔频谱。AlignTTS 基于前馈 Transformer(Feed-Forward Transformer),从字符序列生成梅尔频谱,每个字符的时长由时长预测器确定。与在 Transformer TTS 中采用注意力机制将文本对齐到梅尔频谱不同,我们提出对齐损失,通过动态规划在训练中考虑所有可能的对齐。在 LJSpeech 数据集上的实验表明,我们的模型不仅取得了优于 Transformer TTS 0.03 平均意见得分(MOS)的当前最优性能,而且具有超过实时 50 倍以上的高效率。
引用
@article{arxiv.2003.01950,
title = {AlignTTS: Efficient Feed-Forward Text-to-Speech System without Explicit Alignment},
author = {Zhen Zeng and Jianzong Wang and Ning Cheng and Tian Xia and Jing Xiao},
journal= {arXiv preprint arXiv:2003.01950},
year = {2020}
}
备注
will be presented in ICASSP 2020