利用少量低质量样本进行神经语音克隆
音频与语音处理
2020-06-15 v1 声音
摘要
本文探讨仅使用目标说话人有限数量低质量采集数据实现语音合成的可能性。不同于以往尝试在采集数据上训练整个文本到语音系统的工作,我们试图仅从目标说话人的采集数据中提取说话人嵌入。此外,将自适应与基于说话人编码器的两种说话人模仿方法应用于新发布的LibriTTS数据集与先前发布的VCTK语料库,以考察说话人多样性对清晰度与目标说话人相似度的影响。
引用
@article{arxiv.2006.06940,
title = {Neural voice cloning with a few low-quality samples},
author = {Sunghee Jung and Hoirin Kim},
journal= {arXiv preprint arXiv:2006.06940},
year = {2020}
}