中文

AdaDurIAN:基于 DurIAN 的少样本神经文本到语音自适应

声音 2020-05-13 v1 计算与语言 音频与语音处理

摘要

本文研究如何利用基于 DurIAN 的平均模型,使新说话者在仅拥有极少量单语数据的情况下,兼具准确发音与流畅跨语言说话能力。近期提出的端到端文本到语音(TTS)系统的一个弱点是难以获得鲁棒对齐,阻碍其在极少量数据下良好扩展。为应对此问题,我们引入 AdaDurIAN,通过训练改进的基于 DurIAN 的平均模型,并利用跨说话者共享的说话者无关内容编码器进行少样本学习。实验中的若干少样本学习任务表明,AdaDurIAN 大幅优于基线端到端系统。主观评价亦显示 AdaDurIAN 在自然度平均意见分(MOS)与说话者相似度偏好上更高。此外,我们还将 AdaDurIAN 应用于情感迁移任务,并展示了其良好性能。

关键词

引用

@article{arxiv.2005.05642,
  title  = {AdaDurIAN: Few-shot Adaptation for Neural Text-to-Speech with DurIAN},
  author = {Zewang Zhang and Qiao Tian and Heng Lu and Ling-Hui Chen and Shan Liu},
  journal= {arXiv preprint arXiv:2005.05642},
  year   = {2020}
}

备注

Submitted to InterSpeech 2020