中文

用于改善耳语语音自然度、可懂度与浊音性的生成模型

声音 2023-01-31 v2 音频与语音处理

摘要

本工作适配两种近期生成模型架构,并评估其用于耳语语音到正常语音转换的有效性。我们将正常目标语音纳入向量量化变分自编码器(VQ-VAE)与MelGAN的训练准则,从而条件化系统以从耳语输入中恢复浊音语音。客观与主观质量度量表明,VQ-VAE与MelGAN均可被改造以执行该转换任务。我们发现,相较DiscoGAN基线,所提方法使梅尔倒谱失真(MCD)指标相对提升至少25%。主观听测表明,基于MelGAN的系统相较耳语输入语音在自然度、可懂度与浊音性上均有显著改善。一种基于潜语音表征差异的新评估度量也表明,我们的MelGAN方法相对基线有所提升。

关键词

引用

@article{arxiv.2212.01775,
  title  = {Generative Models for Improved Naturalness, Intelligibility, and Voicing of Whispered Speech},
  author = {Dominik Wagner and Sebastian P. Bayerl and Hector A. Cordourier Maruri and Tobias Bocklet},
  journal= {arXiv preprint arXiv:2212.01775},
  year   = {2023}
}

备注

Accepted at SLT 2022