中文

基于 IPA 的 Tacotron 用于数据高效跨语言说话人适配与发音增强

声音 2022-04-01 v2 机器学习 音频与语音处理

摘要

近期的神经文本转语音(Text-to-Speech, TTS)模型在数据充足时表现极佳。然而,在低资源设定下为新的说话人或语言微调它们并非易事。本文中,我们展示通过对 Tacotron 模型做微小修改,仅用 20 分钟数据即可将已有 TTS 模型迁移至同语言或异语言的新说话人。为此,我们首先引入一个具有语言无关输入的基础多语言 Tacotron,随后演示如何在不借助任何预训练说话人编码器或语码转换技术的情况下,针对不同说话人适配场景完成迁移学习。我们以主客观方式对迁移模型进行了评估。

关键词

引用

@article{arxiv.2011.06392,
  title  = {Using IPA-Based Tacotron for Data Efficient Cross-Lingual Speaker Adaptation and Pronunciation Enhancement},
  author = {Hamed Hemati and Damian Borth},
  journal= {arXiv preprint arXiv:2011.06392},
  year   = {2022}
}

备注

Preprint