中文

Adapitch:基于无转写数据音高解耦条件的自适应多说话人文本到语音合成

声音 2022-10-26 v1 计算与语言 音频与语音处理

摘要

本文中,我们提出 Adapitch,一种多说话人 TTS(文本到语音)方法,利用无转写数据对监督模块进行自适应。我们设计两个自监督模块,分别使用无转写数据训练文本编码器与 mel 解码器,以增强文本与 mel 的表征。为更好地处理合成语音中的韵律信息,设计了一个以音高、文本与说话人内容解耦为条件的监督 TTS 模块。训练阶段分为两部分:以无监督模式预训练并固定文本编码器与 mel 解码器,随后进行 TTS 解耦的监督模式训练。实验结果表明,Adapitch 相比基线方法取得了明显更好的质量。

关键词

引用

@article{arxiv.2210.13803,
  title  = {Adapitch: Adaption Multi-Speaker Text-to-Speech Conditioned on Pitch Disentangling with Untranscribed Data},
  author = {Xulong Zhang and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2210.13803},
  year   = {2022}
}

备注

Accepted by MSN2022, The 18th International Conference on Mobility, Sensing and Networking