基于变分自编码器的语音转换中 F0 调节与全卷积网络的研究
音频与语音处理
2019-07-09 v2 声音
摘要
在本工作中,我们研究了两种用于改进基于变分自编码器 (VAE) 的语音转换 (VC) 技术的有效性。首先,我们重新思考传统 VC 系统中采用的高质量声码器提取的声码器特征之间的关系,并假设频谱特征实际上依赖于 F0。该假设意味着在转换阶段,基于 VAE 的 VC 中的潜变量编码与转换后的特征实际上依赖于源 F0。为此,我们提议将 F0 用作解码器的附加输入。该模型可学习将潜变量编码与 F0 解耦,从而生成依赖于转换后 F0 的转换特征。其次,为了更好地捕捉频谱特征与 F0 模式的时序依赖关系,我们将原始基于 VAE 的 VC 框架中的逐帧转换结构替换为全卷积网络结构。我们的实验表明,解耦程度以及转换语音的自然度确实得到了改善。
引用
@article{arxiv.1905.00615,
title = {Investigation of F0 conditioning and Fully Convolutional Networks in Variational Autoencoder based Voice Conversion},
author = {Wen-Chin Huang and Yi-Chiao Wu and Chen-Chou Lo and Patrick Lumban Tobing and Tomoki Hayashi and Kazuhiro Kobayashi and Tomoki Toda and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:1905.00615},
year = {2019}
}
备注
5 pages, 6 figures, 3 tables; Accepted to Interspeech 2019