基于变分自编码器的普通话语音克隆
声音
2022-03-08 v1 音频与语音处理
摘要
得益于机器学习的进展,语音克隆技术正变得日益成熟。研究人员已通过一些有效模型成功实现了自然听感的英语语音合成以及良好的英语语音克隆。然而,由于普通话的韵律短语划分和庞大字符集,这些模型在中文上的应用尚不完善。通过创建新数据集并将Tacotron合成器替换为VAENAR-TTS,我们改进了现有语音克隆技术CV2TTS,在保证合成质量的同时实现了近乎实时的语音克隆。在此过程中,我们通过附加多种场景定制了合成质量评估的主观测试,使受试者聚焦于语音差异,我们的改进或许更有利于实际应用。A/B测试、实时因子(RTF)以及自然度与相似度方面2.74的平均意见得分(MOS)结果,反映了我们所实现的实时高质量普通话语音克隆。
引用
@article{arxiv.2203.02967,
title = {Variational Auto-Encoder based Mandarin Speech Cloning},
author = {Qingyu Xing and Xiaohan Ma},
journal= {arXiv preprint arXiv:2203.02967},
year = {2022}
}
备注
Submitted to Insterspeech 2022