基于 StyleGAN 的条件式语音数字生成
音频与语音处理
2020-09-17 v3 声音
摘要
本文适配了一种 StyleGAN 模型用于语音生成,对文本的约束最小或没有。StyleGAN 是一种多尺度卷积 GAN,能够在多个空间(或时间)层级上分层捕获数据结构与潜在变化。该模型此前在人脸图像生成上取得了令人印象深刻的成果,并且由于数据中存在的类似多级结构,它对音频应用具有吸引力。在本文中,我们训练一个 StyleGAN 在 Speech Commands 数据集上生成梅尔频率谱图,该数据集包含多个说话人在不同声学条件下说出的数字。在条件设置下,我们的模型以数字身份为条件,而剩余数据变化的学习仍是一项无监督任务。我们将我们的模型与当前无监督最先进的语音合成 GAN 架构 WaveGAN 进行比较,并表明根据数值度量和听测主观评价,所提模型表现更优。
引用
@article{arxiv.2004.13764,
title = {Conditional Spoken Digit Generation with StyleGAN},
author = {Kasperi Palkama and Lauri Juvela and Alexander Ilin},
journal= {arXiv preprint arXiv:2004.13764},
year = {2020}
}
备注
Interspeech2020 accepted version