中文

SLMGAN:在GAN中利用语音语言模型表征进行无监督零样本语音转换

音频与语音处理 2023-07-19 v1 人工智能 声音

摘要

近年来,大规模预训练语音语言模型(SLM)在各种生成式语音建模应用中取得了显著进展,如文本到语音合成、语音转换和语音增强。这些应用通常涉及将文本或语音输入映射到预训练的SLM表征,并从中解码出目标语音。本文提出一种新方法SLMGAN,在生成对抗网络(GAN)框架内利用SLM表征进行判别任务, specifically用于语音转换。在StarGANv2-VC基础上,我们在基于mel的判别器之上增加了新颖的基于SLM的WavLM判别器,以及新设计的SLM特征匹配损失函数,从而得到一个训练时无需文本标签的无监督零样本语音转换系统。主观评价结果表明,SLMGAN在自然度上优于现有最先进的零样本语音转换模型,并取得了相当的相似度,凸显了基于SLM的判别器在相关应用中的潜力。

关键词

引用

@article{arxiv.2307.09435,
  title  = {SLMGAN: Exploiting Speech Language Model Representations for Unsupervised Zero-Shot Voice Conversion in GANs},
  author = {Yinghao Aaron Li and Cong Han and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2307.09435},
  year   = {2023}
}

备注

WASPAA 2023