中文

利用污染数据集通过净化生成对抗网络学习干净数据分布

机器学习 2023-02-06 v1

摘要

生成对抗网络(GAN)以捕捉训练样本底层分布的强大能力而著称。自 GAN 的开创性工作以来,已提出许多变体。然而,现有 GAN 几乎都建立在训练数据集干净这一假设上。但在许多现实应用中,这可能不成立,即训练数据集可能被一部分不期望的实例所污染。在此类数据集上训练时,现有 GAN 会学习期望实例与污染实例的混合分布,而非仅期望数据(目标分布)的期望分布。为从污染数据集中学习目标分布,我们提出了两种净化生成对抗网络(PuriGAN),其中判别器借助仅由污染实例组成的额外数据集获得了区分目标实例与污染实例的能力。我们证明,在某些温和条件下,所提 PuriGAN 保证收敛到期望实例的分布。在多个数据集上的实验结果表明,在污染数据集上训练时,所提 PuriGAN 比可比基线能从期望分布生成好得多的图像。此外,我们还通过将 PuriGAN 应用于污染数据集上的半监督异常检测与 PU-learning 任务,展示了其在下游应用中的有用性。实验结果显示,在两项任务上 PuriGAN 均优于可比基线。

关键词

引用

@article{arxiv.2302.01722,
  title  = {Leveraging Contaminated Datasets to Learn Clean-Data Distribution with Purified Generative Adversarial Networks},
  author = {Bowen Tian and Qinliang Su and Jianxing Yu},
  journal= {arXiv preprint arXiv:2302.01722},
  year   = {2023}
}