用于基于变分自编码器语音转换的精炼WaveNet声码器
音频与语音处理
2020-04-09 v2 计算与语言
声音
摘要
本文提出了一种用于基于变分自编码器(VAE)的语音转换(VC)的WaveNet声码器精炼框架,可减小因训练数据与测试数据失配所导致的质量失真。常规WaveNet声码器使用自然声学特征训练,但在VC的转换阶段以转换后的特征为条件,这种失配常引起显著的质量与相似度下降。本工作中,我们利用VAE的特殊结构,以VAE生成的自重建特征来精炼WaveNet声码器,这些特征与转换特征特性相似,同时与目标自然特征具有相同时序结构。我们分析这些特征并表明自重建特征与转换特征相似。客观与主观实验结果证明了我们所提框架的有效性。
引用
@article{arxiv.1811.11078,
title = {Refined WaveNet Vocoder for Variational Autoencoder Based Voice Conversion},
author = {Wen-Chin Huang and Yi-Chiao Wu and Hsin-Te Hwang and Patrick Lumban Tobing and Tomoki Hayashi and Kazuhiro Kobayashi and Tomoki Toda and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:1811.11078},
year = {2020}
}
备注
5 pages, 7 figures, 1 table. Accepted to EUSIPCO 2019