利用自监督特征训练鲁棒的零样本语音转换模型
声音
2022-02-14 v2 机器学习
音频与语音处理
摘要
无监督零样本语音转换 (VC) 旨在修改话语的说话人特征,使其匹配未见过的目标说话人,而无需依赖平行训练数据。最近,语音表征的自监督学习已被证明可以在不使用转录文本的情况下产生有用的语言单元,这些语言单元可以直接传递给 VC 模型。在本文中,我们表明通过使用长度重采样解码器可以获得高质量的音频样本,该解码器使 VC 模型能够与不同的语言特征提取器和声码器协同工作,而无需它们在相同的序列长度上运行。我们表明我们的方法在 VCTK 数据集上可以优于许多基线。在不修改架构的情况下,我们进一步证明了:a) 使用来自同一说话人的不同音频片段对,b) 添加循环一致性损失,以及 c) 添加说话人分类损失,有助于学习更好的说话人嵌入。我们在 LibriTTS 上使用这些技术训练的模型取得了最佳性能,生成的音频样本很好地转换为目标说话人的声音,同时在按字符错误率衡量时,保留了与真实人类话语相当的语音学内容。
引用
@article{arxiv.2112.04424,
title = {Training Robust Zero-Shot Voice Conversion Models with Self-supervised Features},
author = {Trung Dang and Dung Tran and Peter Chin and Kazuhito Koishida},
journal= {arXiv preprint arXiv:2112.04424},
year = {2022}
}