解释即偏差检测:局部后置可解释性方法公平性探讨的批判性研究
人工智能
2025-05-05 v1 机器学习
摘要
随着人工智能(AI)在显著影响人类生活的领域的日益广泛应用,关于公平性和透明性的关注度日益增加,尤其是针对受保护群体的影响。最近,解释性与公平性的交叉领域已成为促进负责任 AI 系统的重要方向。本文探讨了如何利用可解释性方法来检测和解释不公平现象。我们提出了一条集成局部后置解释方法以获得公平性见解的管道。在设计管道时,我们识别并解决了将解释用作偏差检测器时所涉及的关键问题,例如分配公平与程序公平之间的关系、去除受保护属性后的效果、不同解释方法在结果一致性和质量上的表现、各种聚合策略对群体公平评估的影响,以及解释作为偏差检测器的整体可信度。我们的结果表明,解释方法在公平性应用方面具有潜力,但也凸显了需仔细考虑上述关键方面的必要性。
引用
@article{arxiv.2505.00802,
title = {Explanations as Bias Detectors: A Critical Study of Local Post-hoc XAI Methods for Fairness Exploration},
author = {Vasiliki Papanikou and Danae Pla Karidi and Evaggelia Pitoura and Emmanouil Panagiotou and Eirini Ntoutsi},
journal= {arXiv preprint arXiv:2505.00802},
year = {2025}
}