中文

LUCID-GAN:用于定位不公平性的条件生成模型

机器学习 2023-07-31 v1 计算机与社会

摘要

大多数群体公平性概念通过计算模型输出上的统计奇偶指标来检测不道德偏见。然而,这种方法存在若干缺陷,例如哲学上的分歧、相互不兼容以及缺乏可解释性。这些缺陷促使了互补的偏见检测方法的研发,这些方法对歧视来源提供额外的透明度,并且独立于对公平性定义和保护特征选择的先验决策。近期该方向的一个提议是LUCID(通过规范逆设计定位不公平性,Locating Unfairness through Canonical Inverse Design),其中规范集通过对输入空间执行梯度下降生成,揭示给定偏好输出时模型所需的输入。这种关于模型机制的信息,即哪些特征值对于获得特定输出至关重要,使得暴露其内部逻辑中潜在的不道德偏见成为可能。在此,我们提出LUCID-GAN,其通过条件生成模型而非基于梯度的逆设计来生成规范输入。LUCID-GAN具有若干优势,包括适用于不可微模型、确保规范集由真实输入组成,以及允许评估代理性和交叉性歧视。我们在UCI Adult和COMPAS数据集上对LUCID-GAN进行了实证评估,结果表明它能够在无需访问训练数据的情况下检测黑盒模型中的不道德偏见。

关键词

引用

@article{arxiv.2307.15466,
  title  = {LUCID-GAN: Conditional Generative Models to Locate Unfairness},
  author = {Andres Algaba and Carmen Mazijn and Carina Prunkl and Jan Danckaert and Vincent Ginis},
  journal= {arXiv preprint arXiv:2307.15466},
  year   = {2023}
}

备注

24 pages, 6 figures, 1st World Conference on eXplainable Artificial Intelligence