Taco-VC:基于单说话人 Tacotron 的有限数据语音转换
声音
2020-06-22 v4 机器学习
音频与语音处理
摘要
本文介绍 Taco-VC,一种基于 Tacotron 合成器的语音转换新架构,其为带注意力机制的序列到序列模型。多说话人语音转换系统的训练在训练和语料库规模上都需要大量资源。Taco-VC 使用基于音素后验gram(Phonetic PosteriorGrams, PPGs)的单说话人 Tacotron 合成器以及以梅尔频谱为条件的单说话人 WaveNet 声码器实现。为提升转换语音质量并克服过平滑问题,Tacotron 的输出通过一个新颖的语音增强网络,该网络由音素识别网络与 Tacotron 网络组合而成。我们的系统仅使用单说话人语料库训练,并仅用几分钟训练数据即可适配新说话人。使用中等规模公开数据集,我们的方法在 VCC 2018 SPOKE 非平行语音转换任务中优于基线,并与在大型私有数据集上训练的多说话人网络取得有竞争力的结果。
引用
@article{arxiv.1904.03522,
title = {Taco-VC: A Single Speaker Tacotron based Voice Conversion with Limited Data},
author = {Roee Levy Leshem and Raja Giryes},
journal= {arXiv preprint arXiv:1904.03522},
year = {2020}
}
备注
Accepted to EUSIPCO 2020