中文

HumanACGAN:融合基于人的辅助分类器的条件生成对抗网络及其在音素感知中的评估

人机交互 2021-02-09 v1 机器学习 声音 音频与语音处理

摘要

我们提出了一种融合人类感知评价的条件生成对抗网络(GAN)。GAN中基于深度神经网络(DNN)的生成器能够精确表示真实数据分布,却无法表示人类可接受分布,即无论数据是否真实,人类均认可其自然性的数据范围。HumanGAN被提出用于对人为可接受分布建模:其基于DNN的生成器使用基于人的判别器(即人类的感知评价)而非GAN中基于DNN的判别器进行训练。然而,HumanGAN无法表示条件分布。本文提出HumanACGAN,作为HumanGAN的理论扩展,以处理条件式人类可接受分布。我们的HumanACGAN将人类不仅视为判别器,也视为辅助分类器,从而训练基于DNN的条件生成器。该生成器通过欺骗基于人的判别器(其对无条件自然性打分)和基于人的分类器(其对类条件感知可接受性打分)进行训练。该训练可利用涉及人类感知评价的反向传播算法执行。我们在音素感知上的实验结果表明,我们的HumanACGAN能够成功训练该条件生成器。

关键词

引用

@article{arxiv.2102.04051,
  title  = {HumanACGAN: conditional generative adversarial network with human-based auxiliary classifier and its evaluation in phoneme perception},
  author = {Yota Ueda and Kazuki Fujii and Yuki Saito and Shinnosuke Takamichi and Yukino Baba and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2102.04051},
  year   = {2021}
}

备注

5 pages, 6 figures, to be published in 2021 IEEE International Conference on Acoustics, Speech and Signal Processing