中文

StarGAN-ZSVC:面向低资源场景的零样本语音转换

音频与语音处理 2021-06-02 v1 计算与语言 声音

摘要

语音转换的任务是将在源说话人下说出的语音转换为听起来像由不同的目标说话人说出,同时保留语句的语言内容。近期的进展显著提升了语音转换系统的质量。然而,为了在更广泛场景中发挥作用,语音转换系统需要:(i) 无需平行数据即可训练;(ii) 在零样本设定下工作,即训练时源说话人与目标说话人均未见过;(iii) 实时或更快运行。近期技术满足其中一或两项要求,但无法同时满足三项。本文扩展了基于生成对抗网络(GANs)的近期语音转换模型,以满足全部三项条件。我们具体扩展了近期的 StarGAN-VC 模型,使其以说话人嵌入(来自潜在未见过说话人)为条件。这使得模型可用于零样本设定,因此我们称之为 StarGAN-ZSVC。我们在仅 9 分钟小规模训练集的低资源设定下,将 StarGAN-ZSVC 与其他语音转换技术进行比较。与另一近期神经零样本方法 AutoVC 相比,我们观察到 StarGAN-ZSVC 在零样本设定下略有提升,表明即便用极少数据训练,实时零样本语音转换也是可行的。仍需进一步研究以探明扩展 StarGAN-ZSVC 是否也能提升高资源场景下的零样本语音转换质量。

关键词

引用

@article{arxiv.2106.00043,
  title  = {StarGAN-ZSVC: Towards Zero-Shot Voice Conversion in Low-Resource Contexts},
  author = {Matthew Baas and Herman Kamper},
  journal= {arXiv preprint arXiv:2106.00043},
  year   = {2021}
}

备注

16 pages, 3 figures. Published in Springer Communications in Computer and Information Science, Artificial Intelligence Research (SACAIR 2021), vol. 1342, pp. 69-84, 2020