中文

在人工数据集上训练 GAN 的教训

机器学习 2020-10-16 v2 机器学习

摘要

生成对抗网络(GANs)近年来在合成逼真图像方面取得了巨大进展。然而,它们常在样本过少或属于不同数据分布的类别过多的图像数据集上训练。因此,GANs 易于欠拟合或过拟合,使得对它们的分析困难且受限。因此,为了对 GANs 进行透彻研究并排除数据集引入的不必要干扰,我们在人工数据集上训练它们,其中具有无限多样本且真实数据分布简单、高维并具有结构化流形。此外,生成器被设计成存在最优参数集。经验上,我们发现,在各种距离度量下,生成器未能通过 GAN 训练过程学习到此类参数。我们还发现,当模型复杂度足够高时,训练 GAN 混合相比增加网络深度或宽度带来更多性能提升。我们的实验结果表明,在无监督设定下,生成器混合可自动发现不同模式或不同类别,我们将其归因于生成与判别任务在多个生成器和判别器间的分布。作为我们结论对真实数据集可泛化性的一个例子,我们在 CIFAR-10 数据集上训练了 GAN 混合,我们的方法在流行指标即 Inception Score (IS) 和 Fréchet Inception Distance (FID) 方面显著优于最先进水平。

关键词

引用

@article{arxiv.2007.06418,
  title  = {Lessons Learned from the Training of GANs on Artificial Datasets},
  author = {Shichang Tang},
  journal= {arXiv preprint arXiv:2007.06418},
  year   = {2020}
}