零样语音克隆的多模态对抗训练
音频与语音处理
2024-08-29 v1 机器学习
声音
摘要
训练用于从文本重建语音的文本语音(TTS)模型倾向于预测数据集平均特征,难以建模使人类语音听起来自然的变化。对于零样语音克隆这种需要高变动说话风格训练数据的任务,这一问题尤为突出。我们基于近期使用生成对抗网络(GAN)的研究工作,提出了一种Transformer编码器-解码器架构来条件判别真实与生成语音特征。判别器被用于训练管道,以改进TTS模型的声学特征和韵律特征。我们引入 novel 对抗训练技术,将其应用于FastSpeech2声学模型,并在大型多说话者数据集Libriheavy上进行零样语音克隆任务训练。我们的模型在语音质量和说话人相似性方面均优于基线模型。我们的系统生成的音频示例已在线上提供。
关键词
引用
@article{arxiv.2408.15916,
title = {Multi-modal Adversarial Training for Zero-Shot Voice Cloning},
author = {John Janiczek and Dading Chong and Dongyang Dai and Arlo Faria and Chao Wang and Tao Wang and Yuzong Liu},
journal= {arXiv preprint arXiv:2408.15916},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024