用于改善耳语语音自然度、可懂度与浊音性的生成模型
声音
2023-01-31 v2 音频与语音处理
摘要
本工作适配两种近期生成模型架构,并评估其用于耳语语音到正常语音转换的有效性。我们将正常目标语音纳入向量量化变分自编码器(VQ-VAE)与MelGAN的训练准则,从而条件化系统以从耳语输入中恢复浊音语音。客观与主观质量度量表明,VQ-VAE与MelGAN均可被改造以执行该转换任务。我们发现,相较DiscoGAN基线,所提方法使梅尔倒谱失真(MCD)指标相对提升至少25%。主观听测表明,基于MelGAN的系统相较耳语输入语音在自然度、可懂度与浊音性上均有显著改善。一种基于潜语音表征差异的新评估度量也表明,我们的MelGAN方法相对基线有所提升。
引用
@article{arxiv.2212.01775,
title = {Generative Models for Improved Naturalness, Intelligibility, and Voicing of Whispered Speech},
author = {Dominik Wagner and Sebastian P. Bayerl and Hector A. Cordourier Maruri and Tobias Bocklet},
journal= {arXiv preprint arXiv:2212.01775},
year = {2023}
}
备注
Accepted at SLT 2022