中文

ERNIE-SAT:用于跨语言多说话人语音合成的语音与文本联合预训练

音频与语音处理 2022-12-06 v2 计算与语言 声音

摘要

语音表示学习已改善了单语下的语音理解与语音合成任务。然而,其在跨语言场景中的能力尚未被探索。本文中,我们将预训练方法扩展至跨语言多说话人语音合成任务,包括跨语言多说话人声音克隆与跨语言多说话人语音编辑。我们提出了一种语音-文本联合预训练框架,在给定语音样本及其转写文本时,随机掩码其谱图与音素。通过在不同语言中学习重建输入的掩码部分,我们的模型相较基于说话人嵌入的多说话人 TTS 方法表现出显著提升。此外,我们的框架在训练与推理上均为端到端,无需任何微调。在跨语言多说话人声音克隆与跨语言多说话人语音编辑任务中,实验表明我们的模型优于基于说话人嵌入的多说话人 TTS 方法。

关键词

引用

@article{arxiv.2211.03545,
  title  = {ERNIE-SAT: Speech and Text Joint Pretraining for Cross-Lingual Multi-Speaker Text-to-Speech},
  author = {Xiaoran Fan and Chao Pang and Tian Yuan and He Bai and Renjie Zheng and Pengfei Zhu and Shuohuan Wang and Junkun Chen and Zeyu Chen and Liang Huang and Yu Sun and Hua Wu},
  journal= {arXiv preprint arXiv:2211.03545},
  year   = {2022}
}