用于鲁棒语音克隆的自监督学习
声音
2022-11-04 v2 机器学习
音频与语音处理
摘要
语音克隆是一项困难的任务,需要将鲁棒且信息丰富的特征结合到高质量的 TTS 系统中,才能有效地复制未见说话人的声音。在我们的工作中,我们利用通过 Bootstrap Your Own Latent (BYOL) 方法在自监督框架中学习到的特征,结果表明,当对原始算法应用特定的音频增强时,该方法能够产生高质量的语音表示。我们在训练过程中进一步扩展了增强操作,以帮助生成的特征捕获说话人身份,并使其对噪声和声学条件具有鲁棒性。学习到的特征被用作预训练的话语级嵌入,并作为 Non-Attentive Tacotron 架构的输入,旨在无需利用额外说话人特征的情况下实现多说话人语音合成。该方法使我们能够在无标签的多说话人数据集上训练模型,并使用未见说话人嵌入来复制说话人的声音。主观和客观评估被用于验证所提出的模型,以及其对目标话语声学条件的鲁棒性。
引用
@article{arxiv.2204.03421,
title = {Self-supervised learning for robust voice cloning},
author = {Konstantinos Klapsas and Nikolaos Ellinas and Karolos Nikitaras and Georgios Vamvoukakis and Panos Kakoulidis and Konstantinos Markopoulos and Spyros Raptis and June Sig Sung and Gunu Jho and Aimilios Chalamandaris and Pirros Tsiakoulis},
journal= {arXiv preprint arXiv:2204.03421},
year = {2022}
}
备注
Accepted to INTERSPEECH 2022