中文

VQMIVC:基于矢量量化和互信息的无监督语音表征解耦用于一次性语音转换

音频与语音处理 2021-07-22 v1 计算与语言 多媒体 声音 信号处理

摘要

一次性语音转换(VC)仅使用单个目标说话人语句作为参考来执行任意说话人之间的转换,可通过语音表征解耦有效实现。现有工作通常在训练期间忽略不同语音表征之间的相关性,这导致内容信息泄漏到说话人表征中,从而降低了 VC 性能。为缓解此问题,我们采用矢量量化(VQ)进行内容编码,并在训练中引入互信息(MI)作为相关性度量,以无监督方式通过减少内容、说话人和音高表征之间的相互依赖来实现适当的解耦。实验结果反映了所提方法在学习有效解耦语音表征方面的优越性,这些表征保留了源语言内容和语调变化,同时捕捉目标说话人特征。由此,所提方法比当前最先进的一次性 VC 系统实现了更高的语音自然度和说话人相似度。我们的代码、预训练模型和演示可在 https://github.com/Wendison/VQMIVC 获取。

关键词

引用

@article{arxiv.2106.10132,
  title  = {VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion},
  author = {Disong Wang and Liqun Deng and Yu Ting Yeung and Xiao Chen and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2106.10132},
  year   = {2021}
}

备注

Accepted to Interspeech 2021. Code, pre-trained models and demo are available at https://github.com/Wendison/VQMIVC