中文

面向儿童语音合成的文本转语音流程、评估方法与初步微调结果

声音 2022-04-05 v2 计算与语言 音频与语音处理

摘要

语音合成已经取得了长足进步,当前的文本转语音 (TTS) 模型现在可以生成自然的人声语音。然而,大多数 TTS 研究聚焦于使用成人语音数据,关于儿童语音合成的工作非常有限。本研究开发并验证了一个使用儿童语音数据集微调最先进 (SOTA) 神经 TTS 模型的训练流程。该方法采用多说话人 TTS 重调工作流来提供迁移学习流程。一个公开可用的儿童语音数据集被清洗以提供约 19 小时的较小子集,这构成了我们微调实验的基础。主观和客观评估均使用预训练的 MOSNet 进行客观评估,并使用一种新颖的主观框架进行平均意见得分 (MOS) 评估。主观评估在语音可懂度上获得 3.95 的 MOS,在语音自然度上获得 3.89,在语音一致性上获得 3.96。使用预训练 MOSNet 的客观评估显示真实与合成儿童声音之间强相关。还通过计算话语嵌入之间的余弦相似度验证了说话人相似度。还使用自动语音识别 (ASR) 模型提供真实与合成儿童声音之间的词错误率 (WER) 比较。最终训练的 TTS 模型能够从短至 5 秒的参考音频样本合成儿童般语音。

关键词

引用

@article{arxiv.2203.11562,
  title  = {A Text-to-Speech Pipeline, Evaluation Methodology, and Initial Fine-Tuning Results for Child Speech Synthesis},
  author = {Rishabh Jain and Mariam Yiwere and Dan Bigioi and Peter Corcoran and Horia Cucu},
  journal= {arXiv preprint arXiv:2203.11562},
  year   = {2022}
}

备注

Submitted to IEEE ACCESS