通过群组反事实解释实现程序公平性
机器学习
2026-03-13 v1 人工智能
计算机与社会
摘要
机器学习研究中的公平性主要聚焦于结果导向的公平性标准,如均衡真正率(Equalized Odds),而相对较少关注程序导向的公平性——即模型如何得出其预测。忽略程序公平性可能导致模型为不同受保护群组生成不同的解释,从而削弱信任。本文引入了群组反事实集成梯度(Group Counterfactual Integrated Gradients, GCIG),这是一种用于强制在真实标签条件下跨群组解释恒定性的处理正则化框架。对于每个输入,GCIG计算相对于多个群组条件基准的解释,并在训练期间对这些归因之间的跨群组变异进行惩罚。GCIG将程序公平性形式化为群组反事实解释稳定性,并补充了仅约束预测的现有公平性目标。我们对GCIG进行了经验性比较,测试了六种最先进的方法,结果表明GCIG在保持竞争的预测性能和准确度-公平性权衡方面,显著减少了跨群组解释差异。我们的结果还表明,跨群组对齐模型推理为超越结果平等公平性提供了原则且实用的途径。
引用
@article{arxiv.2603.11140,
title = {Procedural Fairness via Group Counterfactual Explanation},
author = {Gideon Popoola and John Sheppard},
journal= {arXiv preprint arXiv:2603.11140},
year = {2026}
}
备注
16 pages, submitted to ECML 2026