为所有人提供公平的补救:确保个体与群体公平性的反事实解释
机器学习
2026-01-29 v1 人工智能
摘要
可解释人工智能(XAI)正变得越来越重要,以增强机器学习模型的透明度。在各种XAI技术中,反事实解释(counterfactual explanations, CFs)占据核心位置,因为它们能够说明输入特征的何种变化会改变机器学习模型的决策,从而为用户提供可操作的补救方案。确保具有相似属性的个体以及来自不同受保护群体(如人口统计学特征)的个体获得相似且可操作的补救选项,对构建可信赖且公平的决策过程至关重要。本文直接针对这一挑战,聚焦于生成公平的反事实解释。具体而言,我们首先定义并构建公平性于:1)个体公平性,确保相似个体获得相似的反事实解释;2)群体公平性,确保不同受保护群体间获得平等的反事实解释;3)混合公平性,兼顾个体层面的公平与更广泛的群体层面的公平。我们将问题建模为优化任务,提出一种新型模型无关、基于强化学习的方法以生成满足个体与群体层面公平性约束的反事实解释。这两种目标通常被视为正交的,但本工作尝试将其统一。作为公平性度量,我们扩展了用于审计机器学习模型的现有度量,如跨个体与群体的“平等选择补救”和“平等有效性”。我们在三个基准数据集上进行评估,结果表明该方法在保持反事实解释近似性和合理性的前提下,有效实现了个体与群体公平,分别量化了不同层级公平性的代价。本工作为讨论混合公平性及其在XAI及更广泛的反事实解释应用中的作用与影响开启了新的视角。
引用
@article{arxiv.2601.20449,
title = {Fair Recourse for All: Ensuring Individual and Group Fairness in Counterfactual Explanations},
author = {Fatima Ezzeddine and Obaida Ammar and Silvia Giordano and Omran Ayoub},
journal= {arXiv preprint arXiv:2601.20449},
year = {2026}
}