中文

探索低资源情感语音合成中的迁移学习

声音 2019-01-15 v1 计算与语言 音频与语音处理

摘要

在过去几年中,得益于深度学习,口语语言技术取得了巨大进步。然而,基于深度学习的算法需要大量数据,这些数据往往难以收集且成本高昂。特别是,用少量数据建模不同说话人、不同风格或不同情感的语音变异性仍然具有挑战性。在本文中,我们研究了如何利用在预训练的基于深度学习的 TTS 模型上进行微调,以使用另一说话人的小型数据集来合成语音。然后,我们研究了通过用小型情感数据集微调中性 TTS 模型,使该模型适应情感 TTS 的可能性。

关键词

引用

@article{arxiv.1901.04276,
  title  = {Exploring Transfer Learning for Low Resource Emotional TTS},
  author = {Noé Tits and Kevin El Haddad and Thierry Dutoit},
  journal= {arXiv preprint arXiv:1901.04276},
  year   = {2019}
}

备注

Accepted at IntelliSys 2019