DiscreTalk:将文本到语音视为机器翻译问题
计算与语言
2020-05-13 v1 声音
音频与语音处理
摘要
本文提出了一种基于神经机器翻译(NMT)的新型端到端文本到语音(E2E-TTS)模型。该模型由两部分组成:一个非自回归的向量量化变分自编码器(VQ-VAE)模型和一个自回归的Transformer-NMT模型。VQ-VAE模型学习从语音波形到离散符号序列的映射函数,然后训练Transformer-NMT模型以根据给定的输入文本估计该离散符号序列。由于VQ-VAE模型能够以完全数据驱动的方式学习这种映射,我们无需考虑传统E2E-TTS模型中所需的特征提取超参数。得益于离散符号的使用,我们可以利用NMT和自动语音识别(ASR)中开发的各种技术,如束搜索、子词单元以及与语言模型的融合。此外,我们可以避免预测特征的过平滑问题,这是TTS中的常见问题之一。使用JSUT语料库的实验评估表明,所提出的方法在自然度上优于带有非自回归神经声码器的传统Transformer-TTS模型,达到了与VQ-VAE模型重建相当的性能。
关键词
引用
@article{arxiv.2005.05525,
title = {DiscreTalk: Text-to-Speech as a Machine Translation Problem},
author = {Tomoki Hayashi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2005.05525},
year = {2020}
}
备注
Submitted to INTERSPEECH 2020. The demo is available on https://kan-bayashi.github.io/DiscreTalk/