中文

中央库尔德语文本到语音合成:基于新型端到端Transformer训练方法

声音 2024-08-08 v1 音频与语音处理

摘要

近期文本到语音 (TTS) 模型的发展旨在将双阶段流程简化为单阶段训练方法。然而,许多单阶段模型在音频质量方面仍落后,尤其是处理库尔德语文本和语音时。有迫切需要增强库尔德语的文本到语音转换,尤其是针对被相对忽视且在近期文本到语音研究中数据稀缺的索拉尼方言。本研究介绍了一种高效生成高质量库尔德语音频的端到端TTS模型。该方法利用了预训练用于音频波形重构的变分自编码器 (VAE),并通过对抗训练进行增强。这涉及将预训练编码器建立的先验分布与潜变量中文本编码器的后验分布对齐。此外,还引入了随机持续时间预测器,使合成的库尔德语语音具有多样化的节奏。通过对齐潜在分布并集成随机持续时间预测器,该方法促进了自然库尔德语语音的实时生成,提供了在音高和节奏方面的灵活性。通过对自定义数据集进行的平均意见得分 (MOS) 实证评估,确认了我们方法的优越性能 (MOS为3.94),其表现优于一个单阶段系统和其他两个阶段系统,根据主观人类评估得出。

关键词

引用

@article{arxiv.2408.03887,
  title  = {Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training},
  author = {Hawraz A. Ahmad and Tarik A. Rashid},
  journal= {arXiv preprint arXiv:2408.03887},
  year   = {2024}
}

备注

19 pages