中文

基于解耦表示的泛化零样本说话人自适应语音合成

声音 2023-08-28 v1 人工智能 音频与语音处理

摘要

尽管大多数语音合成研究集中于为数据集内说话人合成高质量语音,一个同样重要但未解决的问题是为具有有限参考数据的数据集外未见说话人合成语音,即说话人自适应语音合成。许多研究提出了针对该任务的零样本说话人自适应文本到语音和语音转换方法。然而,由于模型在分布外数据上泛化性差,大多数现有方法在为未见说话人(即不在训练数据集中的说话人)合成语音时,自然度和说话人相似度会下降。为解决此问题,我们提出GZS-TV,一种泛化零样本说话人自适应文本到语音和语音转换模型。GZS-TV引入针对说话人嵌入提取和音色变换的解耦表示学习以提升模型泛化性,并利用变分自编码器的表示学习能力增强说话人编码器。我们的实验表明,GZS-TV减少了在未见说话人上的性能下降,并在多个数据集中优于所有基线模型。

关键词

引用

@article{arxiv.2308.13007,
  title  = {Generalizable Zero-Shot Speaker Adaptive Speech Synthesis with Disentangled Representations},
  author = {Wenbin Wang and Yang Song and Sanjay Jha},
  journal= {arXiv preprint arXiv:2308.13007},
  year   = {2023}
}

备注

5 pages, 3 figures. Accepted by Interspeech 2023, Oral