ELAICHI:通过解决不频繁和低频字符双gram来提升低资源 TTS
计算与语言
2024-10-24 v1 音频与语音处理
摘要
近期 TTS 技术的进展导致英语合成语音听觉自然,主要归功于大规模高质量网络数据的可用性。然而,许多其他语言缺乏此类资源,仅依赖有限的录音室质量数据。这种稀缺性导致合成语音常常出现听觉可理解性问题,尤其是针对低频字符双gram。为解决此挑战,我们提出三项解决方案:首先,我们利用来自语言或地理上相关语言的高质量数据来改进目标语言的 TTS;其次,我们利用来自非录音室环境中记录的低质量自动语音识别(ASR)数据,并通过去噪和语音增强模型进行细化;最后,我们使用来自大规模模型的知识蒸馏技术生成更稳健的输出。我们使用 Hindi 进行实验,证实可显著减少听觉可理解性问题,人类评估者已验证这一点。我们将此方法论证为缺乏高质量数据的语言提供了可行的替代方案,使其能够从共享资源中集体受益。
引用
@article{arxiv.2410.17901,
title = {ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams},
author = {Srija Anand and Praveen Srinivasa Varadhan and Mehak Singal and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2410.17901},
year = {2024}
}
备注
11 pages, 1 figure, 3 tables