基于对抗互信息学习的语音表征解耦用于单样本语音转换
音频与语音处理
2022-08-24 v1 机器学习
声音
摘要
仅以单条目标说话人语音作为参考的单样本语音转换(VC)已成为研究热点。现有工作通常仅解耦音色,而音高、节奏与内容信息仍混在一起。为有效执行单样本 VC 并进一步解耦这些语音成分,我们对音高与内容编码器采用随机重采样,并利用互信息的变分对比对数比上界与基于梯度反转层(gradient reversal layer)的对抗互信息学习,以确保潜空间不同部分在训练时仅包含所需的解耦表征。在 VCTK 数据集上的实验表明,该模型在单样本 VC 的自然度与可懂度方面达到了最先进的性能。此外,我们通过语音表征解耦可分别迁移单样本 VC 在音色、音高与节奏上的特性。我们的代码、预训练模型与演示可在 https://im1eon.github.io/IS2022-SRDVC/ 获取。
引用
@article{arxiv.2208.08757,
title = {Speech Representation Disentanglement with Adversarial Mutual Information Learning for One-shot Voice Conversion},
author = {SiCheng Yang and Methawee Tantrawenith and Haolin Zhuang and Zhiyong Wu and Aolan Sun and Jianzong Wang and Ning Cheng and Huaizhen Tang and Xintao Zhao and Jie Wang and Helen Meng},
journal= {arXiv preprint arXiv:2208.08757},
year = {2022}
}
备注
5 pages,5 figures,INTERSPEECH 2022