中文

多说话人文本转语音的领域对抗训练

音频与语音处理 2020-06-15 v1

摘要

多说话人文本转语音(TTS)必须同时学习语言嵌入与文本嵌入,以生成具有期望语言内容且音色符合要求的语音。然而,目前尚不清楚语音的哪些特征源于说话人,哪些部分源于语言内容。本文利用我们引入的辅助说话人分类器与梯度反转层,迫使文本嵌入遗忘说话人相关特征。我们使用角间隔softmax损失训练说话人分类器。主观评价表明,针对单语多说话人TTS的文本嵌入对抗训练使相似度MOS提升39.9%,自然度MOS提升40.1%。

关键词

引用

@article{arxiv.2006.06942,
  title  = {Domain-adversarial training of multi-speaker TTS},
  author = {Sunghee Jung and Hoirin Kim},
  journal= {arXiv preprint arXiv:2006.06942},
  year   = {2020}
}