中文

利用 MOS 预测直接最大化语音质量以训练神经文本到语音合成

音频与语音处理 2022-05-26 v5 机器学习 声音

摘要

尽管最近的神经文本到语音(TTS)系统已实现高质量语音合成,但仍存在 TTS 系统生成低质量语音的情况,主要由训练数据有限或知识蒸馏过程中的信息损失引起。因此,我们提出一种新方法,通过在感知损失监督下训练 TTS 模型来提升语音质量,该感知损失衡量最大可能语音质量分数与预测分数之间的距离。我们首先预训练一个平均意见分数(MOS)预测模型,然后训练 TTS 模型以利用预训练的 MOS 预测模型最大化合成语音的 MOS。所提方法可独立应用,无论 TTS 模型架构或语音质量下降的原因如何,且不会增加推理时间或模型复杂度,效率很高。MOS 和音素错误率的评估结果表明,我们提出的方法在自然度和可懂度两方面均优于先前模型。

关键词

引用

@article{arxiv.2011.01174,
  title  = {Learning to Maximize Speech Quality Directly Using MOS Prediction for Neural Text-to-Speech},
  author = {Yeunju Choi and Youngmoon Jung and Youngjoo Suh and Hoirin Kim},
  journal= {arXiv preprint arXiv:2011.01174},
  year   = {2022}
}

备注

9 pages, 5 figures, 4 tables