在半监督 VQ-VAE 范式下学习解耦的音素与说话人表征
音频与语音处理
2021-02-11 v2 机器学习
声音
摘要
我们提出一种新方法,通过对用于语音合成的 VQ-VAE 架构引入新组件来解耦说话人声音与音素内容。原始 VQ-VAE 对未见过的说话人或内容泛化不佳。为缓解此问题,我们加入了一个说话人编码器与说话人 VQ 码本,其完全独立于已有的子音素码本来学习全局说话人特征。我们还比较了两种训练方法:带全局条件的自监督与带说话人标签的半监督。添加说话人 VQ 组件改善了语音合成质量的客观度量(估计 MOS、说话人相似度、基于 ASR 的可懂度),并提供了有意义的习得表征。我们的说话人 VQ 码本索引可用于简单的说话人日志任务,且表现略优于 x-vector 基线。此外,在我们半监督 VQ-VAE 中,从子音素 VQ 码本索引识别音素的能力优于带全局条件的自监督。
引用
@article{arxiv.2010.10727,
title = {Learning Disentangled Phone and Speaker Representations in a Semi-Supervised VQ-VAE Paradigm},
author = {Jennifer Williams and Yi Zhao and Erica Cooper and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2010.10727},
year = {2021}
}
备注
Accepted to ICASSP 2021