中文

基于自监督韵律表征学习的零样本语音转换

声音 2022-06-01 v2 人工智能 音频与语音处理

摘要

面向未见说话人的语音转换(VC),亦称零样本 VC,是一个引人关注的研究课题,因为它支持语音定制、动画制作等一系列应用。该领域的近期工作通过解耦方法取得进展,这些方法从语音录音中分离语句内容与说话人特征。然而,其中许多方法存在韵律(如音高、音量)泄漏问题,导致合成语音中的说话人声音不同于目标说话人。为防止此问题,我们提出一种新颖的自监督方法,有效学习解耦的音高与音量表征,可表示不同说话人的韵律风格。随后我们将习得的韵律表征作为条件信息来训练并增强我们的 VC 模型以实现零样本转换。实验中,我们表明我们的韵律表征是解耦的且富含韵律信息。此外,我们证明加入我们的韵律表征提升了 VC 性能,并超越了最先进的零样本 VC 性能。

关键词

引用

@article{arxiv.2110.14422,
  title  = {Zero-shot Voice Conversion via Self-supervised Prosody Representation Learning},
  author = {Shijun Wang and Dimche Kostadinov and Damian Borth},
  journal= {arXiv preprint arXiv:2110.14422},
  year   = {2022}
}

备注

Published in: 2022 International Joint Conference on Neural Networks (IJCNN)