VQMIVC:基于矢量量化和互信息的无监督语音表征解耦用于一次性语音转换
音频与语音处理
2021-07-22 v1 计算与语言
多媒体
声音
信号处理
摘要
一次性语音转换(VC)仅使用单个目标说话人语句作为参考来执行任意说话人之间的转换,可通过语音表征解耦有效实现。现有工作通常在训练期间忽略不同语音表征之间的相关性,这导致内容信息泄漏到说话人表征中,从而降低了 VC 性能。为缓解此问题,我们采用矢量量化(VQ)进行内容编码,并在训练中引入互信息(MI)作为相关性度量,以无监督方式通过减少内容、说话人和音高表征之间的相互依赖来实现适当的解耦。实验结果反映了所提方法在学习有效解耦语音表征方面的优越性,这些表征保留了源语言内容和语调变化,同时捕捉目标说话人特征。由此,所提方法比当前最先进的一次性 VC 系统实现了更高的语音自然度和说话人相似度。我们的代码、预训练模型和演示可在 https://github.com/Wendison/VQMIVC 获取。
引用
@article{arxiv.2106.10132,
title = {VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion},
author = {Disong Wang and Liqun Deng and Yu Ting Yeung and Xiao Chen and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2106.10132},
year = {2021}
}
备注
Accepted to Interspeech 2021. Code, pre-trained models and demo are available at https://github.com/Wendison/VQMIVC