中文

TabFairGAN:基于生成对抗网络的公平表格数据生成

机器学习 2021-09-03 v1 人工智能

摘要

随着对自动化决策依赖的加深,算法公平性问题日益重要。本文提出一种用于表格数据生成的生成对抗网络(GAN)。模型包含两阶段训练。第一阶段训练模型以准确生成类似于参考数据集的合成数据。第二阶段修改价值函数以加入公平性约束,并继续训练网络以生成既准确又公平的数据。我们在无约束与有约束公平数据生成两种情形下测试了结果。无约束情形下,即模型仅在第一阶段训练且仅用于生成遵循真实数据相同联合概率分布的准确数据,结果显示本模型优于文献中提出的最先进GAN以生成合成表格数据。此外,在第一阶段训练后续以第二阶段的有约束情形下,我们在公平文献中研究的四个数据集上训练并测试网络,与另一种最先进预处理方法比较,展示了其取得的有前景结果。相较于其他利用GAN进行公平数据生成的研究,我们的模型因仅用单一判别器且通过实现Wasserstein GAN避免了原始GAN模型的主要如模式丢弃与不收敛等问题而更具稳定性。

关键词

引用

@article{arxiv.2109.00666,
  title  = {TabFairGAN: Fair Tabular Data Generation with Generative Adversarial Networks},
  author = {Amirarsalan Rajabi and Ozlem Ozmen Garibay},
  journal= {arXiv preprint arXiv:2109.00666},
  year   = {2021}
}