一种用于无监督非平行语音域自适应的多判别器 CycleGAN
计算与语言
2018-07-11 v4 机器学习
摘要
域自适应在语音识别模型中起着重要作用,尤其是对于低资源域。我们提出了一种基于循环一致生成对抗网络(CycleGAN)的新型生成模型,用于无监督非平行语音域自适应。所提出的模型在功率谱图上采用多个独立的判别器,每个判别器负责不同的频带。因此,我们实现了 1)更好的判别器,专注于频率特征的细粒度细节;以及 2)能够生成更真实域自适应谱图的生成器。我们在性别自适应的语音识别上展示了我们方法的有效性,其中模型在训练时仅能访问某一性别的监督数据,但在测试时评估于另一性别。与基线相比,我们的模型在 TIMIT 和 WSJ 数据集上分别实现了音素错误率平均 7.41% 和词错误率 11.10% 的相对性能提升。在定性上,当以另一域的数据为条件时,我们的模型也生成了更自然听感的语音。
引用
@article{arxiv.1804.00522,
title = {A Multi-Discriminator CycleGAN for Unsupervised Non-Parallel Speech Domain Adaptation},
author = {Ehsan Hosseini-Asl and Yingbo Zhou and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:1804.00522},
year = {2018}
}
备注
Accepted to Interspeech 2018