Mixer-TTS:基于语言模型嵌入条件的非自回归快速紧凑文本转语音模型
音频与语音处理
2021-10-25 v2
摘要
本文描述了 Mixer-TTS,一种用于梅尔频谱图生成的非自回归模型。该模型基于适用于语音合成的 MLP-Mixer 架构。基础版 Mixer-TTS 包含音高和时长预测器,其中时长预测器使用无监督 TTS 对齐框架进行训练。除基础模型外,我们提出了扩展版本,其额外使用了来自预训练语言模型的词元嵌入。基础版 Mixer-TTS 及其扩展版本分别取得了 4.05 和 4.11 的平均意见得分(MOS),而原始 LJSpeech 样本的 MOS 为 4.27。两个版本均具有较少的参数数量,并能够实现比质量相近的模型快得多的语音合成。
引用
@article{arxiv.2110.03584,
title = {Mixer-TTS: non-autoregressive, fast and compact text-to-speech model conditioned on language model embeddings},
author = {Oktai Tatanov and Stanislav Beliaev and Boris Ginsburg},
journal= {arXiv preprint arXiv:2110.03584},
year = {2021}
}
备注
Preprint. Submitted to ICASSP-22