基于深度学习的合成语音自然度评估
声音
2021-04-26 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
在本文中,我们提出一种用于合成语音自然度的新客观预测模型。它可用于评估文本转语音(Text-To-Speech)或语音转换(Voice Conversion)系统,并且与语言无关。该模型以端到端方式训练,基于一个此前在语音质量估计中表现出良好结果的 CNN-LSTM 网络。我们在 16 个不同数据集上训练和测试该模型,例如来自 Blizzard Challenge 和 Voice Conversion Challenge 的数据集。此外,我们表明,通过从基于客观 POLQA 分数训练的语音质量预测模型进行迁移学习,可提升基于深度学习的自然度预测的可靠性。所提模型已公开可用,并可例如用于评估不同的 TTS 系统配置。
引用
@article{arxiv.2104.11673,
title = {Deep Learning Based Assessment of Synthetic Speech Naturalness},
author = {Gabriel Mittag and Sebastian Möller},
journal= {arXiv preprint arXiv:2104.11673},
year = {2021}
}
备注
Late upload, presented at Interspeech 2020