端到端框架中具有快速自适应的通用印度语文本转语音合成器
音频与语音处理
2022-11-01 v1
摘要
由于活跃语言数量众多,为印度语言构建文本转语音(TTS)合成器是一项困难的任务。印度语言可分为有限的语言族,其中 prominent 的是印度-雅利安语族和达罗毗荼语族。本文提出的工作利用这一性质,在同一语族的多语言上以端到端框架构建通用 TTS 系统。通用系统相当鲁棒,因为它们能够捕捉跨语言的多种音系结构。随后利用少量自适应数据将这些系统自适应到同一语族中的新语言。实验表明,仅使用 7 分钟自适应数据即可构建高质量的 TTS 系统。自适应 TTS 的平均退化平均意见得分为 3.98。对通用 TTS 中语言间系统性交互进行了广泛分析。引入 x-vectors 作为说话人嵌入以特定说话人声音合成文本。一个有趣的观察是目标说话人声音的音律得以保留。这些结果颇具前景,表明通用 TTS 能够无缝处理说话人与语言切换,并且易于自适应到新语言。
引用
@article{arxiv.2006.06971,
title = {Generic Indic Text-to-speech Synthesisers with Rapid Adaptation in an End-to-end Framework},
author = {Anusha Prakash and Hema A Murthy},
journal= {arXiv preprint arXiv:2006.06971},
year = {2022}
}