中文

BOFFIN TTS:基于贝叶斯优化的少样本说话人自适应

音频与语音处理 2020-02-07 v1 机器学习 声音 机器学习

摘要

我们提出 BOFFIN TTS(Bayesian Optimization For FIne-tuning Neural Text To Speech,用于微调神经文本转语音的贝叶斯优化),一种用于少样本说话人自适应的新方法。此处任务为使用少量目标语音语料微调预训练的 TTS 模型以模仿新说话人。我们证明并不存在一刀切的适应策略,令人信服的合成需要针对语料特定地配置控制微调的超参数。通过使用贝叶斯优化为目标说话人高效优化这些超参数值,我们得以实现自适应,相较标准技术在说话人相似度上平均提升 30%。结果表明,在多个语料上,BOFFIN TTS 可使用少于十分钟音频学习合成新说话人,并达到与用于训练基础模型的说话人相同的自然度。

关键词

引用

@article{arxiv.2002.01953,
  title  = {BOFFIN TTS: Few-Shot Speaker Adaptation by Bayesian Optimization},
  author = {Henry B. Moss and Vatsal Aggarwal and Nishant Prateek and Javier González and Roberto Barra-Chicote},
  journal= {arXiv preprint arXiv:2002.01953},
  year   = {2020}
}