基于跨域特征与使用变分自编码器的语音转换
音频与语音处理
2020-04-09 v1 计算与语言
机器学习
声音
摘要
一种有效的非平行语音转换(VC)方法是利用深度神经网络(DNNs),特别是变分自编码器(VAEs),以无监督方式建模语音的潜在结构。先前研究已证实使用STRAIGHT谱的VAE用于VC的有效性。然而,使用其他类型谱特征(如与人感知相关且广泛用于VC的梅尔倒谱系数(MCCs))的VAE尚未得到恰当研究。相较于使用单一特定类型谱特征,预期VAE可同时利用多种谱特征从而提升其用于VC的能力。为此,我们提出一种用于VC的新型VAE框架(称为跨域VAE,CDVAE)。具体而言,该框架通过显式正则化多个目标来利用STRAIGHT谱与MCCs,以约束所学编码器与解码器的行为。实验结果表明,所提CDVAE框架在主观测试中优于传统VAE框架。
引用
@article{arxiv.1808.09634,
title = {Voice Conversion Based on Cross-Domain Features Using Variational Auto Encoders},
author = {Wen-Chin Huang and Hsin-Te Hwang and Yu-Huai Peng and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:1808.09634},
year = {2020}
}
备注
Accepted to ISCSLP 2018