反事实公平性评估的部分识别方法
机器学习
2025-10-02 v1 人工智能
计算机与社会
统计方法学
摘要
AI 决策系统在刑事司法、贷款批准和招聘等关键领域的广泛采用加剧了对算法公平性的关注。由于我们通常仅能获取算法输出,无法洞察其内部机制,便自然引发对辅助敏感属性(如种族)改变后决策如何变化的探讨。这导致研究社区提出了反事实公平性度量,但如何从可用数据评估这些度量仍是具有挑战性的任务。在许多实际应用中,目标反事实度量不可识别,即无法从定量数据与定性知识的组合唯一确定。本文采用部分识别方法,从观察数据推导出反事实公平性度量的informative bounds。我们引入贝叶斯方法,以高置信度界定未知的反事实公平性度量。我们在 COMPAS 数据集上演示了该算法,考察了关于种族、年龄和性别的 recidivism risk score 的公平性。我们的结果揭示了当将种族改变为非裔裔美国人时 COMPAS 分数呈现正(伪)效果,而当年龄从年轻变为年老时则表现出负(直接因果)效果。
关键词
引用
@article{arxiv.2510.00163,
title = {Partial Identification Approach to Counterfactual Fairness Assessment},
author = {Saeyoung Rho and Junzhe Zhang and Elias Bareinboim},
journal= {arXiv preprint arXiv:2510.00163},
year = {2025}
}