人工智能 (AI) 解释的公平性:统一框架、公理及迈向负责任 AI 的未来方向
人工智能
2026-05-12 v1 计算工程、金融与科学
计算机与社会
机器学习
摘要
机器学习算法正被用于高风险决策,包括刑事司法、医疗保健、信贷和就业。研究界对此作出了两个基本独立的研究领域的响应:旨在实现公平结果的算法公平性,以及旨在提供可解释推理的可解释 AI (XAI)。本综述识别并映射了它们交叉点处的一个新颖盲点:一个模型可以在其输出中满足所有标准公平性准则,同时在其推理过程中却极度不公平。我们将此称为程序偏差,缓解它需要将解释的公平性作为一个独立的科学研究对象。据我们所知,我们提供了这一新兴领域的首个统一的理论与文献综述,并阐明了事后解释器在认证解释公平性方面的缺陷。我们的核心贡献是一个条件不变性框架,将解释公平性形式化为以下要求:对于所有与任务相关的 ,无论受保护属性如何,解释都应保持不变 ,所有现有的解释公平性指标均作为该单一原理的部分操作化形式从中衍生。我们引入了一个七维分类法,识别了三种解释不公平的产生机制(表示驱动、解释模型不匹配、可操作性驱动),并提出了一个规范的六步评估工作流,用于在实践中操作化解释公平性审计。
引用
@article{arxiv.2605.09852,
title = {Fairness of Explanations in Artificial Intelligence (AI): A Unifying Framework, Axioms, and Future Direction toward Responsible AI},
author = {Gideon Popoola and John Sheppard},
journal= {arXiv preprint arXiv:2605.09852},
year = {2026}
}
备注
53 pages, 1 figure