中文

无意识公平设定下基于反事实推理的偏差评估与检测

机器学习 2023-08-29 v2 人工智能 计算机与社会

摘要

当前的 AI 法规要求在其算法决策过程中舍弃敏感特征(如性别、种族、宗教)以防止不公平结果。然而,即便训练集中无敏感特征,算法仍可持续存在歧视。事实上,当敏感特征被省略时(无意识公平),它们可通过与所谓代理特征的非线性关系被推断出来。在本文中,我们提出了一种揭示机器学习模型潜在隐藏偏差的方法,该偏差即便在敏感特征被丢弃后仍可能持续。本研究表明,利用反事实推理可揭示黑盒预测器是否仍存在偏差。具体而言,当预测器给出负分类结果时,我们的方法首先为受歧视用户类别构建反事实样本以获得正结果。随后,相同的反事实样本输入一个针对敏感特征的外部分类器,该分类器揭示为获得正结果所需的用户特征修改是否将个体移入了非歧视组。当发生此情况时,它可能是决策过程中歧视行为的警示信号。此外,我们利用反事实相对于原始样本的偏离来确定哪些特征是特定敏感信息的代理。我们的实验表明,即便模型在无敏感特征下训练,其仍常遭受歧视性偏差。

关键词

引用

@article{arxiv.2302.08204,
  title  = {Counterfactual Reasoning for Bias Evaluation and Detection in a Fairness under Unawareness setting},
  author = {Giandomenico Cornacchia and Vito Walter Anelli and Fedelucio Narducci and Azzurra Ragone and Eugenio Di Sciascio},
  journal= {arXiv preprint arXiv:2302.08204},
  year   = {2023}
}