零样本与少样本多说话人语音合成:基于预训练的捷克语 SpeechT5 模型
声音
2024-09-26 v1 计算与语言
音频与语音处理
摘要
本文实验了在大规模数据集上预训练的 SpeechT5 模型。我们从头预训练基础模型,并在大规模鲁棒性多说话人文本转语音(TTS)任务上进行微调。我们测试了模型在零样本和少样本场景下的能力。基于两个听觉测试,我们评估了合成音频的质量以及合成语音与真实语音的相似度。我们的结果表明,SpeechT5 模型仅需目标说话人约一分钟的数据,即可为其生成合成语音。我们成功在公开的捷克语政治人物和名人面前,展示了合成语音的高质量和高相似度。
引用
@article{arxiv.2407.17167,
title = {Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model},
author = {Jan Lehečka and Zdeněk Hanzlíček and Jindřich Matoušek and Daniel Tihelka},
journal= {arXiv preprint arXiv:2407.17167},
year = {2024}
}
备注
Accepted to TSD2024