用于语音转换的条件深度分层变分自编码器
声音
2021-12-07 v1 机器学习
音频与语音处理
摘要
基于变分自编码器的语音转换(VAE-VC)具有仅需语音对和说话人标签即可训练的优势。与多数聚焦于利用辅助损失或离散化隐变量的 VAE-VC 研究不同,本文探究了提升模型表达能力对 VAE-VC 的益处与影响。具体而言,我们首先从率失真角度分析 VAE-VC,指出模型表达能力对 VAE-VC 至关重要,因为率与失真分别反映转换语音的相似度与自然度。基于该分析,我们提出一种使用深度分层 VAE 的新型 VC 方法,其具有高模型表达能力,且得益于非自回归解码器而具备快速转换速度。此外,我们的分析揭示了另一问题:当 VAE 的隐变量含有冗余信息时相似度会下降。我们通过使用 -VAE 目标控制隐变量所含信息来解决该问题。在使用 VCTK 语料的实验中,所提方法在跨性别设定下自然度与相似度的平均意见得分均超过 3.5,高于现有基于自编码器的 VC 方法。
引用
@article{arxiv.2112.02796,
title = {Conditional Deep Hierarchical Variational Autoencoder for Voice Conversion},
author = {Kei Akuzawa and Kotaro Onishi and Keisuke Takiguchi and Kohki Mametani and Koichiro Mori},
journal= {arXiv preprint arXiv:2112.02796},
year = {2021}
}