中文

GlowVC:用于语言无关无文本语音转换的梅尔谱空间解耦模型

音频与语音处理 2022-07-05 v1 计算与语言 机器学习

摘要

本文中,我们提出 GlowVC:一种用于语言无关无文本语音转换的多语言多说话人流式模型。我们基于 Glow-TTS 构建,其提供的架构可在训练时使用语言特征而无需在 VC 推理时使用。我们考虑模型的两个版本:GlowVC-conditional 与 GlowVC-explicit。GlowVC-conditional 以说话人条件化流对梅尔谱分布建模,并将梅尔谱空间解耦为内容与音高相关维度;而 GlowVC-explicit 以非条件化流对显式分布建模,并将该空间解耦为内容、音高与说话人相关维度。我们在已见与未见语言的语内及跨语言转换场景下,从可懂度、说话人相似度与自然度方面评估我们的模型。GlowVC 模型在可懂度上大幅优于 AutoVC 基线,同时在语内 VC 中达到同等高的说话人相似度,在跨语言设定下略低。此外,我们证明 GlowVC-explicit 在自然度上超越 GlowVC-conditional 与 AutoVC。

关键词

引用

@article{arxiv.2207.01454,
  title  = {GlowVC: Mel-spectrogram space disentangling model for language-independent text-free voice conversion},
  author = {Magdalena Proszewska and Grzegorz Beringer and Daniel Sáez-Trigueros and Thomas Merritt and Abdelhamid Ezzerg and Roberto Barra-Chicote},
  journal= {arXiv preprint arXiv:2207.01454},
  year   = {2022}
}

备注

Accepted at Interspeech 2022