中文

使用解耦且可解释表示进行一次性跨语言语音转换的研究

声音 2018-08-17 v1 音频与语音处理

摘要

我们研究了非平行语音语料库和一次性学习设定下的跨语言语音转换问题。大多数先前工作要么需要平行语音语料库,要么需要来自目标说话人足够量的训练数据。然而,我们仅给定目标说话人的一条训练语音,就将任意源说话人的任意句子转换为目标说话人的声音。为实现这一点,我们将该问题表述为学习解耦的说话人特定和上下文特定表示,并遵循[1]中使用分解分层变分自编码器(FHVAE)的思想。在多说话人训练数据上训练FHVAE后,给定任意源和目标说话人的语音,我们估计这些潜在表示,然后重构转换为目标说话人声音所需的语音。我们通过进行不同训练语音数量的语音转换实验考察该方法的有效性,其仅用一条训练语音也能取得合理性能。我们还检验了语音表示,表明World声码器优于[1]中使用的短时傅里叶变换(STFT)。最后,在主观测试中,对于单语言和跨语言语音转换,我们的方法在语音质量和相似度上相比VAE-STFT和GMM基线取得了显著更好或相当的结果。

关键词

引用

@article{arxiv.1808.05294,
  title  = {Investigation of Using Disentangled and Interpretable Representations for One-shot Cross-lingual Voice Conversion},
  author = {Seyed Hamidreza Mohammadi and Taehwan Kim},
  journal= {arXiv preprint arXiv:1808.05294},
  year   = {2018}
}

备注

Proceedings of Interspeech 2018