基于语言模型的无希伯来语音系统方法
计算与语言
2024-07-18 v1 声音
音频与语音处理
摘要
我们解决希伯来语语音合成(TTS)中的文本到语音问题。传统希伯来语包含音调符号,这些音调符号决定给定单词的发音方式,但现代希伯来语很少使用这些音调符号。缺乏音调符号导致读者需要根据上下文推断正确的发音并理解应使用哪些音素,这对TTS系统在文本到语音之间的准确映射构成根本性挑战。本文提出采用无音调符号的方法来解决希伯来语TTS问题。该模型基于离散语音表示,条件化于单词片段标记器。我们使用野外弱监督数据优化该方法,并将其与几种基于音调符号的TTS系统进行比较。结果表明,所提出的方法在保持内容保真度和语音自然度方面均优于所评估的基线方法。样本可在以下链接获取:pages.cs.huji.ac.il/adiyoss-lab/HebTTS/
引用
@article{arxiv.2407.12206,
title = {A Language Modeling Approach to Diacritic-Free Hebrew TTS},
author = {Amit Roth and Arnon Turetzky and Yossi Adi},
journal= {arXiv preprint arXiv:2407.12206},
year = {2024}
}
备注
Accepted at Interspeech24