AdaDurIAN:基于 DurIAN 的少样本神经文本到语音自适应
声音
2020-05-13 v1 计算与语言
音频与语音处理
摘要
本文研究如何利用基于 DurIAN 的平均模型,使新说话者在仅拥有极少量单语数据的情况下,兼具准确发音与流畅跨语言说话能力。近期提出的端到端文本到语音(TTS)系统的一个弱点是难以获得鲁棒对齐,阻碍其在极少量数据下良好扩展。为应对此问题,我们引入 AdaDurIAN,通过训练改进的基于 DurIAN 的平均模型,并利用跨说话者共享的说话者无关内容编码器进行少样本学习。实验中的若干少样本学习任务表明,AdaDurIAN 大幅优于基线端到端系统。主观评价亦显示 AdaDurIAN 在自然度平均意见分(MOS)与说话者相似度偏好上更高。此外,我们还将 AdaDurIAN 应用于情感迁移任务,并展示了其良好性能。
引用
@article{arxiv.2005.05642,
title = {AdaDurIAN: Few-shot Adaptation for Neural Text-to-Speech with DurIAN},
author = {Zewang Zhang and Qiao Tian and Heng Lu and Ling-Hui Chen and Shan Liu},
journal= {arXiv preprint arXiv:2005.05642},
year = {2020}
}
备注
Submitted to InterSpeech 2020