中文

使用渐进式 WaveGAN 的语音指令生成

计算与语言 2019-03-19 v1 机器学习 声音 音频与语音处理 机器学习

摘要

生成对抗网络(GANs)因在图像生成方面的成功,已在广泛的数据驱动研究领域中变得极受欢迎。其从通常仅少量输入数据生成新样本的能力,使其在数据资源有限的领域成为令人振奋的研究工具。GAN 一个较少被探索的应用是语音与音频样本的合成。在此,我们提出一组对 WaveGAN 范式(一种近期提出的基于 GAN 的声音生成方法)的扩展。这些扩展——预处理、音频到音频生成、跳跃连接与渐进式结构——旨在提升合成语音样本的人类相似度。来自30名志愿者的听测评分表明,相较于原始 WaveGAN 方法,使用所提扩展在人类相似度上有中等程度提升(Cohen's d 系数为 0.65)。

关键词

引用

@article{arxiv.1903.07395,
  title  = {Voice command generation using Progressive Wavegans},
  author = {Thomas Wiest and Nicholas Cummins and Alice Baird and Simone Hantke and Judith Dineley and Björn Schuller},
  journal= {arXiv preprint arXiv:1903.07395},
  year   = {2019}
}

备注

7 pages, 2 figures