中文

利用多语言与单语言 VQ-VAE 探索解耦表征

音频与语音处理 2021-06-29 v2 声音

摘要

本工作考察了两个分别训练的自向量量化变分自编码器(VQ-VAE)系统所得解耦的音素与说话人表征的内容及用处:一个在多语言数据上训练,另一个在单语言数据上训练。我们利用四项小型概念验证任务来探索多语言与单语言模型:复制合成、声音转换、语言码切换以及基于内容的隐私掩蔽。从这些任务中,我们反思解耦的音素与说话人表征如何被用于以有意义的方式操纵语音。我们的实验表明,VQ 表征适用于这些任务,包括通过混合说话人表征来创造新声音。我们还提出了一种新技术,通过操纵音素 VQ 码来隐藏语句中目标词的内容,同时保留说话人身份及周围词的可懂度。最后,我们讨论了进一步提升解耦表征可行性的建议。

关键词

引用

@article{arxiv.2105.01573,
  title  = {Exploring Disentanglement with Multilingual and Monolingual VQ-VAE},
  author = {Jennifer Williams and Jason Fong and Erica Cooper and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2105.01573},
  year   = {2021}
}

备注

Accepted to Speech Synthesis Workshop 2021 (SSW11)