面向低资源高表现力语音的显式时长建模非自回归 TTS
声音
2021-06-29 v2 人工智能
机器学习
摘要
尽管近期的神经文本到语音(TTS)方法能生成高质量语音,但它们通常需要目标说话人的大量录音。在先前工作中,提出了一种 3 步方法以在大幅减少训练所需数据量的同时生成高质量 TTS。然而,我们观察到在使用该方法时,高表现力嗓音可达到的自然度存在天花板效应。本文中,我们提出一种仅使用目标说话人 15 分钟语音数据即可构建高表现力 TTS 嗓音的方法。与当前最先进(state-of-the-art)方法相比,我们提出的改进将语音自然度与录音的差距缩小了 23.3%,说话人相似度差距缩小了 16.3%。此外,仅使用 15 分钟目标说话人数据,我们便匹配了基于 Tacotron2 的全数据(约 10 小时)模型的自然度与说话人相似度;而使用 30 分钟或更多数据时,我们显著优于该模型。提出以下改进:1)从自回归、基于注意力的 TTS 模型改为非自回归模型,以外部时长模型替代注意力;2)一个额外的基于条件生成对抗网络(cGAN)的微调步骤。
引用
@article{arxiv.2106.12896,
title = {Non-Autoregressive TTS with Explicit Duration Modelling for Low-Resource Highly Expressive Speech},
author = {Raahil Shah and Kamil Pokora and Abdelhamid Ezzerg and Viacheslav Klimkov and Goeric Huybrechts and Bartosz Putrycz and Daniel Korzekwa and Thomas Merritt},
journal= {arXiv preprint arXiv:2106.12896},
year = {2021}
}
备注
6 pages, 5 figures. Accepted to Speech Synthesis Workshop (SSW) 2021