探索低资源情感语音合成中的迁移学习
声音
2019-01-15 v1 计算与语言
音频与语音处理
摘要
在过去几年中,得益于深度学习,口语语言技术取得了巨大进步。然而,基于深度学习的算法需要大量数据,这些数据往往难以收集且成本高昂。特别是,用少量数据建模不同说话人、不同风格或不同情感的语音变异性仍然具有挑战性。在本文中,我们研究了如何利用在预训练的基于深度学习的 TTS 模型上进行微调,以使用另一说话人的小型数据集来合成语音。然后,我们研究了通过用小型情感数据集微调中性 TTS 模型,使该模型适应情感 TTS 的可能性。
引用
@article{arxiv.1901.04276,
title = {Exploring Transfer Learning for Low Resource Emotional TTS},
author = {Noé Tits and Kevin El Haddad and Thierry Dutoit},
journal= {arXiv preprint arXiv:1901.04276},
year = {2019}
}
备注
Accepted at IntelliSys 2019