中文

通过解耦表示学习改进零样本语音风格迁移

音频与语音处理 2021-03-18 v1 声音

摘要

语音风格迁移,亦称语音转换,旨在修改某说话人的语音以生成仿佛来自另一(目标)说话人的语音。以往工作在利用并行训练数据与预知说话人的语音转换上已取得进展。然而,从非并行数据学习并为先前未见过的说话人生成语音的零样本语音风格迁移,仍是一个具有挑战性的问题。我们提出一种通过解耦表示学习的新型零样本语音迁移方法。该方法首先将每个输入语音的说话人相关风格与语音内容编码至分离的低维嵌入空间,随后通过解码器结合源内容嵌入与目标风格嵌入来迁移至新语音。在信息论引导下,风格与内容嵌入空间具有代表性且(理想地)彼此独立。在真实世界 VCTK 数据集上,我们的方法在多数对多数与零样本设置下的语音风格迁移实验中,于迁移准确率与语音自然度方面均优于其他基线并取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.2103.09420,
  title  = {Improving Zero-shot Voice Style Transfer via Disentangled Representation Learning},
  author = {Siyang Yuan and Pengyu Cheng and Ruiyi Zhang and Weituo Hao and Zhe Gan and Lawrence Carin},
  journal= {arXiv preprint arXiv:2103.09420},
  year   = {2021}
}

备注

To appear in ICLR 2021