中文

基于深度学习的合成语音自然度评估

声音 2021-04-26 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

在本文中,我们提出一种用于合成语音自然度的新客观预测模型。它可用于评估文本转语音(Text-To-Speech)或语音转换(Voice Conversion)系统,并且与语言无关。该模型以端到端方式训练,基于一个此前在语音质量估计中表现出良好结果的 CNN-LSTM 网络。我们在 16 个不同数据集上训练和测试该模型,例如来自 Blizzard Challenge 和 Voice Conversion Challenge 的数据集。此外,我们表明,通过从基于客观 POLQA 分数训练的语音质量预测模型进行迁移学习,可提升基于深度学习的自然度预测的可靠性。所提模型已公开可用,并可例如用于评估不同的 TTS 系统配置。

关键词

引用

@article{arxiv.2104.11673,
  title  = {Deep Learning Based Assessment of Synthetic Speech Naturalness},
  author = {Gabriel Mittag and Sebastian Möller},
  journal= {arXiv preprint arXiv:2104.11673},
  year   = {2021}
}

备注

Late upload, presented at Interspeech 2020