面向零资源语音挑战赛 2020 的端到端合成器探索
音频与语音处理
2020-09-11 v1 声音
摘要
针对未见语言的口语对话系统被称为零资源语音。它尤其有益于为数字资源匮乏的语言开发应用。零资源语音合成是在缺乏转写文本情况下构建文本到语音(TTS)模型的任务。本工作中,语音被建模为瞬态与稳态声学单元的序列,并通过迭代训练发现一组独特的声学单元。利用该声学单元序列训练 TTS 模型。本工作的主要目标是提升零资源 TTS 系统的合成质量。提出了四种不同系统。所有系统均包含三个阶段:单元发现,随后是单元序列到谱图的映射,最后是谱图到语音的逆变换。针对谱图映射阶段提出了若干改进。这些改进包括在人声数据上训练映射、使用 x-vectors 改善映射、两阶段学习以及性别相关建模。在 Zerospeech 2020 挑战赛中对所提系统的评估表明,可以获得相当好的合成质量。
引用
@article{arxiv.2009.04983,
title = {Exploration of End-to-end Synthesisers forZero Resource Speech Challenge 2020},
author = {Karthik Pandia D S and Anusha Prakash and Mano Ranjith Kumar and Hema A Murthy},
journal= {arXiv preprint arXiv:2009.04983},
year = {2020}
}
备注
Accepted for publication in Interspeech 2020