中文

使用变分自编码器从非平行语料库进行语音转换

机器学习 2016-10-14 v1 机器学习 声音

摘要

我们提出了一个灵活的频谱转换 (SC) 框架,该框架促进了使用未对齐语料库进行训练。许多 SC 框架需要平行语料库、语音对齐或明确的逐帧对应关系,以学习转换函数或在对齐的辅助下合成目标频谱。然而,由于平行语料库的稀缺甚至不可用,这些要求严重限制了 SC 在实际应用中的范围。我们提出了一个基于变分自编码器的 SC 框架,使我们能够利用非平行语料库。该框架包含一个学习与说话人无关的语音表示的编码器和一个学习重建特定说话人的解码器。它去除了训练频谱转换系统对平行语料库或语音对齐的要求。我们报告了客观和主观评估以验证我们提出的方法,并将其与能够访问已对齐语料库的 SC 方法进行了比较。

关键词

引用

@article{arxiv.1610.04019,
  title  = {Voice Conversion from Non-parallel Corpora Using Variational Auto-encoder},
  author = {Chin-Cheng Hsu and Hsin-Te Hwang and Yi-Chiao Wu and Yu Tsao and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:1610.04019},
  year   = {2016}
}