中文

利用多模态学习改进少样本语音克隆

声音 2022-03-21 v1 计算与语言 音频与语音处理

摘要

近年来,少样本语音克隆取得了显著进展。然而,多数少样本语音克隆模型为单模态,多模态少样本语音克隆研究不足。本文提出利用多模态学习提升少样本语音克隆性能。受近期无监督语音表示工作的启发,所提出的多模态系统通过为 Tacotron2 扩展无监督语音表示模块构建。我们在两种少样本语音克隆场景中评估所提系统,即少样本文本到语音(TTS)与语音转换(VC)。实验结果表明,相较于对应的单模态系统,所提多模态学习能显著提升少样本语音克隆性能。

关键词

引用

@article{arxiv.2203.09708,
  title  = {Improve few-shot voice cloning using multi-modal learning},
  author = {Haitong Zhang and Yue Lin},
  journal= {arXiv preprint arXiv:2203.09708},
  year   = {2022}
}

备注

2022 IEEE International Conference on Acoustics, Speech and Signal Processing