利用大规模无标注语音语料库的低资源文本转语音迁移学习框架
音频与语音处理
2022-10-07 v2 机器学习
摘要
训练文本转语音(TTS)模型需要大规模带文本标注的语音语料库,而这类语料库的收集十分繁琐。本文提出一种利用大量无标注语音数据集进行预训练的 TTS 迁移学习框架。通过借助 wav2vec2.0 表征,无标注语音可显著提升性能,尤其在缺乏标注语音的情况下。我们还将所提方法扩展至零样本多说话人 TTS(ZS-TTS)。实验结果在自然度、可懂度以及说话人泛化能力方面验证了所提方法的有效性。我们强调,仅在 10 分钟带标注数据集上微调的单说话人 TTS 模型优于其他基线,而仅在 30 分钟单说话人数据集上微调的 ZS-TTS 模型可通过在无标注多说话人语音语料库上的预训练生成任意说话人的声音。
引用
@article{arxiv.2203.15447,
title = {Transfer Learning Framework for Low-Resource Text-to-Speech using a Large-Scale Unlabeled Speech Corpus},
author = {Minchan Kim and Myeonghun Jeong and Byoung Jin Choi and Sunghwan Ahn and Joun Yeop Lee and Nam Soo Kim},
journal= {arXiv preprint arXiv:2203.15447},
year = {2022}
}
备注
Accepted by Interspeech2022