中文

通过模型再平衡处理极端不平衡类分布的公平 GAN

计算机视觉与模式识别 2023-12-22 v2 计算机与社会 机器学习

摘要

深度生成模型需要大量训练数据。这常常带来问题,因为数据集的收集可能昂贵且困难,尤其是能代表适当底层分布(如人口统计分布)的数据集。这在数据集中引入了偏差,并进一步在模型中传播。我们提出一种方法,通过再平衡模型分布,从已有的有偏生成对抗网络(GAN)构建无偏 GAN。具体做法是使用进化算法从已有的不平衡深度生成模型生成平衡数据,然后用这些数据训练平衡生成模型。此外,我们提出一种偏差缓解损失函数,使所学类分布偏离等概率的程度最小化。我们在 Flickr Faces High Quality(FFHQ)数据集上训练 StyleGAN2 模型以考察种族公平性,结果显示所提方法将公平性指标提升近 5 倍,同时保持图像质量。我们进一步将方法应用于不平衡的 CIFAR10 数据集进行验证,表明可获得与在平衡且规模大一倍的 CIFAR10 数据集上训练相当的公平性与图像质量。最后,我们认为传统的图像质量指标如 Frechet inception distance(FID)在不平衡类分布且无可用的平衡参考集的场景下并不适用。

关键词

引用

@article{arxiv.2308.08638,
  title  = {Fair GANs through model rebalancing for extremely imbalanced class distributions},
  author = {Anubhav Jain and Nasir Memon and Julian Togelius},
  journal= {arXiv preprint arXiv:2308.08638},
  year   = {2023}
}