中文

CAFP:基于反事实模型平均的群体公平性后处理框架

人工智能 2026-04-09 v1 机器学习

摘要

在机器学习预测中确保公平性是一个关键挑战,尤其是在信用评分、医疗保健和刑事司法等敏感领域部署模型时。虽然许多公平干预依赖数据预处理或训练中的算法约束,但这些方法通常需要对模型架构拥有完全控制权以及访问受保护属性信息,而这在现实系统中可能不可行。本文提出了反事实平均以实现公平预测(Counterfactual Averaging for Fair Predictions, CAFP),一种无需重新训练或修改原始分类器即可消除受保护属性不公平影响的模型无关后处理方法。CAFP通过生成每个输入的反事实版本(其中敏感属性被翻转),然后对事实和反事实实例的模型预测进行平均。我们对CAFP进行了理论分析,展示了其消除对受保护属性的直接依赖性、降低预测与敏感属性之间的互信息,以及对引入的偏差进行可证明的上界。 在轻度假设下,我们进一步证明CAFP实现完美的人口公平,并将等效机会偏差至少减少一半的平均反事实偏差。

关键词

引用

@article{arxiv.2604.07009,
  title  = {CAFP: A Post-Processing Framework for Group Fairness via Counterfactual Model Averaging},
  author = {Irina Arévalo and Marcos Oliva},
  journal= {arXiv preprint arXiv:2604.07009},
  year   = {2026}
}