利用多模态学习改进少样本语音克隆
声音
2022-03-21 v1 计算与语言
音频与语音处理
摘要
近年来,少样本语音克隆取得了显著进展。然而,多数少样本语音克隆模型为单模态,多模态少样本语音克隆研究不足。本文提出利用多模态学习提升少样本语音克隆性能。受近期无监督语音表示工作的启发,所提出的多模态系统通过为 Tacotron2 扩展无监督语音表示模块构建。我们在两种少样本语音克隆场景中评估所提系统,即少样本文本到语音(TTS)与语音转换(VC)。实验结果表明,相较于对应的单模态系统,所提多模态学习能显著提升少样本语音克隆性能。
引用
@article{arxiv.2203.09708,
title = {Improve few-shot voice cloning using multi-modal learning},
author = {Haitong Zhang and Yue Lin},
journal= {arXiv preprint arXiv:2203.09708},
year = {2022}
}
备注
2022 IEEE International Conference on Acoustics, Speech and Signal Processing