NAUTILUS:一种通用语音克隆系统
音频与语音处理
2020-10-08 v2 计算与语言
声音
摘要
我们介绍了一种新颖的语音合成系统,称为 NAUTILUS,它既能从文本输入也能从任意源说话人的参考语音生成具有目标声音的语音。通过在初始训练阶段使用多说话人语音语料库训练所有必需的编码器与解码器,我们的系统可基于反向传播算法利用目标说话人的无转录语音克隆未见过的声音。此外,根据目标说话人的数据情况,克隆策略可调整以利用额外数据并修改文本到语音(TTS)和/或语音转换(VC)系统的行为以适应情形。我们通过使用深度卷积层建模编码器、解码器与 WaveNet 声码器来测试所提框架的性能。评估显示,仅用五分钟无转录语音克隆时,其取得了与最先进 TTS 和 VC 系统可比的质量。此外,证明了所提框架具有以高说话人一致性在 TTS 与 VC 间切换的能力,这将对许多应用有用。
引用
@article{arxiv.2005.11004,
title = {NAUTILUS: a Versatile Voice Cloning System},
author = {Hieu-Thi Luong and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2005.11004},
year = {2020}
}
备注
Submitted to The IEEE/ACM Transactions on Audio, Speech, and Language Processing