BOFFIN TTS:基于贝叶斯优化的少样本说话人自适应
音频与语音处理
2020-02-07 v1 机器学习
声音
机器学习
摘要
我们提出 BOFFIN TTS(Bayesian Optimization For FIne-tuning Neural Text To Speech,用于微调神经文本转语音的贝叶斯优化),一种用于少样本说话人自适应的新方法。此处任务为使用少量目标语音语料微调预训练的 TTS 模型以模仿新说话人。我们证明并不存在一刀切的适应策略,令人信服的合成需要针对语料特定地配置控制微调的超参数。通过使用贝叶斯优化为目标说话人高效优化这些超参数值,我们得以实现自适应,相较标准技术在说话人相似度上平均提升 30%。结果表明,在多个语料上,BOFFIN TTS 可使用少于十分钟音频学习合成新说话人,并达到与用于训练基础模型的说话人相同的自然度。
引用
@article{arxiv.2002.01953,
title = {BOFFIN TTS: Few-Shot Speaker Adaptation by Bayesian Optimization},
author = {Henry B. Moss and Vatsal Aggarwal and Nishant Prateek and Javier González and Roberto Barra-Chicote},
journal= {arXiv preprint arXiv:2002.01953},
year = {2020}
}