中文

Meta-TTS:用于少样本说话人自适应文本到语音的元学习

声音 2022-08-01 v3 计算与语言 音频与语音处理

摘要

个性化语音合成系统是一个备受期待的应用,该系统可利用用户极少的上线录音生成具有用户声音的语音。近期构建此类系统主要有两种方法:说话人自适应与说话人编码。一方面,说话人自适应方法使用少量上线样本微调训练好的多说话人文本到语音(TTS)模型。然而,它们需要至少数千步微调才能实现高质量自适应,难以在设备上应用。另一方面,说话人编码方法将注册语句编码为说话人嵌入。训练好的 TTS 模型可以基于相应说话人嵌入合成用户语音。不过,说话人编码器存在所见与未见说话人之间的泛化鸿沟。本文中,我们提出将元学习算法应用于说话人自适应方法。更具体地,我们使用模型无关元学习(MAML)作为多说话人 TTS 模型的训练算法,旨在找到一个优良的元初始化,使模型能快速自适应于任意少样本说话人自适应任务。因此,我们也能高效地将元训练后的 TTS 模型自适应于未见说话人。我们的实验将所提方法(Meta-TTS)与两个基线比较:一个说话人自适应方法基线和一个说话人编码方法基线。评估结果表明,与说话人自适应基线相比,Meta-TTS 能用更少的自适应步数从少量注册样本合成高说话人相似度语音,并在相同训练方案下优于说话人编码基线。当基线的说话人编码器使用额外 8371 名说话人数据预训练时,Meta-TTS 在 LibriTTS 数据集上仍优于基线,并在 VCTK 数据集上取得相当结果。

关键词

引用

@article{arxiv.2111.04040,
  title  = {Meta-TTS: Meta-Learning for Few-Shot Speaker Adaptive Text-to-Speech},
  author = {Sung-Feng Huang and Chyi-Jiunn Lin and Da-Rong Liu and Yi-Chen Chen and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2111.04040},
  year   = {2022}
}

备注

IEEE/ACM Transactions on Audio, Speech, and Language Processing