基于参考模型的低资源TTS半监督学习
声音
2022-10-27 v1 人工智能
音频与语音处理
摘要
以往的大多数神经文本转语音(TTS)方法主要基于监督学习方法,这意味着它们依赖于大型训练数据集,并且在低资源条件下难以达到可比的性能。为了解决这个问题,我们提出了一种用于神经TTS的半监督学习方法,其中标记的目标数据是有限的,该方法还可以解决以前自回归模型中的曝光偏差问题。具体来说,我们基于Fastspeech2利用大量源数据预训练参考模型,并在有限的目标数据集上进行微调。同时,由原始参考模型生成的伪标签用于进一步指导微调模型的训练,实现正则化效果,并减少微调模型在有限目标数据上训练期间的过拟合。实验结果表明,我们提出的在有限目标数据下的半监督学习方案显著提高了测试数据的语音质量,在语音合成中实现了自然度和鲁棒性。
引用
@article{arxiv.2210.14723,
title = {Semi-Supervised Learning Based on Reference Model for Low-resource TTS},
author = {Xulong Zhang and Jianzong Wang and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2210.14723},
year = {2022}
}
备注
Accepted by NMIC2022, The Fourth International Workshop on Network Meets Intelligent Computations