中文

基于域对抗训练从含噪样本中进行数据高效语音克隆

音频与语音处理 2020-08-12 v2 声音

摘要

数据高效语音克隆旨在仅利用少量注册样本合成目标说话人语音。为此,说话人自适应与说话人编码是基于多说话人基模型训练的两种典型方法。前者使用一小批目标说话人数据通过直接模型更新将多说话人模型迁移至目标说话人语音,而后者仅将几秒目标说话人音频与多说话人模型一起通过额外的说话人编码模型合成目标说话人语音,无需模型更新。然而,这两种方法均需干净的目标说话人数据。但在实际应用中,用户提供的样本难免包含声学噪声。利用含噪数据生成目标语音仍具挑战性。本文在研究基于序列到序列TTS范式下从含噪样本的数据高效语音克隆问题。具体而言,我们将域对抗训练(DAT)引入说话人自适应与说话人编码,旨在从语音-噪声混合中解耦噪声。实验表明,对于说话人自适应与编码,所提方法均能一致地从含噪说话人样本合成干净语音,明显优于采用最先进语音增强模块的方法。

关键词

引用

@article{arxiv.2008.04265,
  title  = {Data Efficient Voice Cloning from Noisy Samples with Domain Adversarial Training},
  author = {Jian Cong and Shan Yang and Lei Xie and Guoqiao Yu and Guanglu Wan},
  journal= {arXiv preprint arXiv:2008.04265},
  year   = {2020}
}

备注

Accepted to INTERSPEECH 2020