中文

基于最先进神经说话人嵌入的零样本多说话人文本转语音

音频与语音处理 2020-02-05 v2

摘要

虽然使用说话人嵌入的端到端语音合成的说话人自适应能为训练期间见过的说话人产生良好的说话人相似度,但对于未见说话人的零样本自适应仍存在差距。我们研究端到端文本转语音合成的多说话人建模,并研究不同类型的最先进神经说话人嵌入对未见说话人相似度的影响。基于可学习字典编码的说话人嵌入配合角softmax损失,能在说话人验证任务中将等错误率优于x-vectors;当用于端到端语音合成中对新说话人的零样本自适应时,这些嵌入也改善了未见说话人的说话人相似度和自然度。

关键词

引用

@article{arxiv.1910.10838,
  title  = {Zero-Shot Multi-Speaker Text-To-Speech with State-of-the-art Neural Speaker Embeddings},
  author = {Erica Cooper and Cheng-I Lai and Yusuke Yasuda and Fuming Fang and Xin Wang and Nanxin Chen and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:1910.10838},
  year   = {2020}
}

备注

Accepted to ICASSP 2020