使用 LPCNet 的高质量、轻量且可适配的 TTS 系统
音频与语音处理
2019-06-27 v2 声音
摘要
我们提出了一种具有高质量输出且轻量可适配的神经 TTS(文本转语音)系统。该系统由三个独立的神经网络模块组成:韵律预测、声学特征预测和作为神经声码器的线性预测编码网(LPCNet)。该系统能以接近自然的质量合成语音,同时在标准 CPU 上以比实时快 3 倍的速度运行。系统的模块化设置允许使用少量数据对新音色进行简单适配。我们首先展示了系统在大型高质量数据集上训练时产生高质量语音的能力。随后,我们使用 5 至 20 分钟时长且录音质量较低的未见过的音色数据集进行模仿,展示了其适配能力。给出了大规模平均意见得分(MOS)质量和相似度测试,表明该系统能够适配未见过的音色:相比自然语音,男声质量差距为 0.12、相似度差距为 3%,女声质量差距为 0.35、相似度差距为 9%。
引用
@article{arxiv.1905.00590,
title = {High quality, lightweight and adaptable TTS using LPCNet},
author = {Zvi Kons and Slava Shechtman and Alex Sorin and Carmel Rabinovitz and Ron Hoory},
journal= {arXiv preprint arXiv:1905.00590},
year = {2019}
}
备注
Accepted to Interspeech 2019