中文

HumanGAN:以人类为判别器的生成对抗网络及其在语音感知建模中的评估

声音 2019-09-26 v1 神经与进化计算 音频与语音处理

摘要

我们提出 HumanGAN,一种将人类感知作为判别器纳入的生成对抗网络(GAN)。基本 GAN 通过训练生成器来欺骗区分真实数据与生成数据的判别器,从而表征真实数据分布。因此,基本 GAN 无法表征真实数据分布之外的部分。在语音感知的情形中,人类不仅能将人声识别为人声,也能将经过处理的(即不存在的人的)声音识别为人声。这种人类可接受的分布通常比真实数据分布更宽,且无法由基本 GAN 建模。为对人类可接受的分布建模,我们将人类感知视为黑盒判别器,构建了基于反向传播的生成器训练算法。该训练通过计算机进行生成器训练与通过众包进行判别的高效迭代。我们在语音自然度建模中评估了我们的 HumanGAN,并证明其能够表征比真实数据分布更宽的人类可接受分布。

关键词

引用

@article{arxiv.1909.11391,
  title  = {HumanGAN: generative adversarial network with human-based discriminator and its evaluation in speech perception modeling},
  author = {Kazuki Fujii and Yuki Saito and Shinnosuke Takamichi and Yukino Baba and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:1909.11391},
  year   = {2019}
}

备注

Submitted to IEEE ICASSP 2020