中文

DuDGAN:通过双扩散改进类条件 GAN

计算机视觉与模式识别 2023-06-07 v2 图像与视频处理

摘要

使用生成对抗网络(GANs)的类条件图像生成已通过多种技术得到研究;然而,在类内差异较大的数据集情况下,它仍面临模式崩溃、训练不稳定和输出质量低等挑战。此外,大多数 GAN 往往在较大迭代次数下才收敛,导致训练过程中的迭代效率低下。虽然 Diffusion-GAN 已显示出生成逼真样本的潜力,但其在生成类条件样本方面存在关键局限。为克服这些局限,我们提出了一种使用 GAN 进行类条件图像生成的新型方法,称为 DuDGAN,其引入了基于双扩散的噪声注入过程。我们的方法由三个独特网络组成:判别器、生成器和分类器。在训练过程中,高斯混合噪声以不同方式注入到两个噪声感知网络(判别器和分类器)中。这些噪声数据通过逐步引入更具挑战性的任务来帮助防止过拟合,从而提升模型性能。因此,我们的方法在性能上优于最先进的类条件 GAN 图像生成模型。我们使用 AFHQ、Food-101 和 CIFAR-10 数据集评估了我们的方法,并观察到在 FID、KID、Precision 和 Recall 分数等指标上相比对比模型具有更优结果,凸显了我们方法的有效性。

关键词

引用

@article{arxiv.2305.14849,
  title  = {DuDGAN: Improving Class-Conditional GANs via Dual-Diffusion},
  author = {Taesun Yeom and Minhyeok Lee},
  journal= {arXiv preprint arXiv:2305.14849},
  year   = {2023}
}

备注

8 page, 3 figures, supplementary material included