多说话人文本转语音的领域对抗训练
音频与语音处理
2020-06-15 v1
摘要
多说话人文本转语音(TTS)必须同时学习语言嵌入与文本嵌入,以生成具有期望语言内容且音色符合要求的语音。然而,目前尚不清楚语音的哪些特征源于说话人,哪些部分源于语言内容。本文利用我们引入的辅助说话人分类器与梯度反转层,迫使文本嵌入遗忘说话人相关特征。我们使用角间隔softmax损失训练说话人分类器。主观评价表明,针对单语多说话人TTS的文本嵌入对抗训练使相似度MOS提升39.9%,自然度MOS提升40.1%。
引用
@article{arxiv.2006.06942,
title = {Domain-adversarial training of multi-speaker TTS},
author = {Sunghee Jung and Hoirin Kim},
journal= {arXiv preprint arXiv:2006.06942},
year = {2020}
}