中文

无监督TTS数据选择:以阿拉伯语广播新闻为例

计算与语言 2023-01-27 v2 声音 音频与语音处理

摘要

当前若干高资源文本转语音(TTS)系统已能生成自然、成熟类人的语音。相比之下,包括阿拉伯语在内的低资源语言因资源匮乏,其TTS系统非常有限。我们提出一种全无监督的TTS构建方法,涵盖自动数据选择与TTS训练的预训练/微调策略,并以广播新闻为案例。我们展示了如何经精心选择、虽量更少的数据,可提升TTS系统生成比基于更大数据集训练的系统更自然语音的效率。我们采用并提出以下不同方案:1)数据:我们应用DNSMOS自动标注、自动元音化及自动语音识别(ASR)修正转写错误;2)模型:我们使用高资源语言在TTS模型上的迁移学习,并以一小时广播录音微调,随后用该模型引导基于FastSpeech2的Conformer模型进行时长建模。客观评测显示字符错误率(CER)为3.9%,而真值CER为1.3%。主观评测中(1为差、5为优),我们的基于FastSpeech2的Conformer模型在可懂度上取得4.4的平均意见分(MOS),自然度上取得4.2,且多名标注者识别出播音员嗓音,证明了我们所提无监督方法的有效性。

关键词

引用

@article{arxiv.2301.09099,
  title  = {Unsupervised Data Selection for TTS: Using Arabic Broadcast News as a Case Study},
  author = {Massa Baali and Tomoki Hayashi and Hamdy Mubarak and Soumi Maiti and Shinji Watanabe and Wassim El-Hajj and Ahmed Ali},
  journal= {arXiv preprint arXiv:2301.09099},
  year   = {2023}
}