面向未见说话人语音克隆的跨语言多说话人文本到语音合成(无需平行语料)
音频与语音处理
2019-11-27 v1
摘要
我们研究一种新颖的跨语言多说话人文本到语音合成方法,用于为英语和普通话中的母语/外语、已见/未见说话人生成高质量的母语或带口音语音。该系统由三个分别训练的组件构成:x-vector 说话人编码器、基于 Tacotron 的合成器以及 WaveNet 声码器。它以三类嵌入为条件:(1) 说话人嵌入,使系统可用许多说话人的语音训练,且每人数据很少;(2) 共享音素输入的语言嵌入;(3) 重音与声调嵌入,提升合成语音的自然度,尤其对普通话这类声调语言。通过调整各类嵌入,MOS 结果显示我们的方法能为母语/外语已见/未见说话人生成高质量、自然且可懂的母语语音。如预期,带口音语音的可懂度与自然度较低。母语说话人母语语音的说话人相似度良好。有趣的是,外国说话人带口音语音的说话人相似度也良好。我们还发现,以 L2 范数归一化或白化对说话人嵌入 x-vector 归一化,在许多情况下大幅改善输出质量,且 WaveNet 性能似乎与语言无关:我们的 WaveNet 以粤语语音训练,却能很好地用于生成普通话与英语语音。
引用
@article{arxiv.1911.11601,
title = {Cross-lingual Multi-speaker Text-to-speech Synthesis for Voice Cloning without Using Parallel Corpus for Unseen Speakers},
author = {Zhaoyu Liu and Brian Mak},
journal= {arXiv preprint arXiv:1911.11601},
year = {2019}
}
备注
Submitted to ICASSP 2020