中文

可解释性中的性别偏见:探究事后解释方法的性能差异

计算与语言 2025-05-05 v1 人工智能 机器学习

摘要

尽管关于解释方法的应用和评估的研究不断扩展,但解释方法在不同子群体间性能差异的公平性仍然是一个常被忽视的方面。本文通过展示在三个任务和五个语言模型中,广泛使用的事后特征归因方法在其忠实性、鲁棒性和复杂性方面表现出显著的性别差异,从而弥补了这一空白。即使模型是在特别无偏的数据集上预训练或微调的,这些差异依然存在,这表明我们观察到的差异不仅仅是训练数据有偏的结果。我们的结果强调了在开发和应用可解释性方法时解决解释中的差异的重要性,因为这些差异可能导致针对特定子群体的有偏结果,在高风险情境下具有尤为关键的影响。此外,我们的发现强调了将解释的公平性,连同整体模型公平性和可解释性,作为监管框架中的一项要求的重要性。

关键词

引用

@article{arxiv.2505.01198,
  title  = {Gender Bias in Explainability: Investigating Performance Disparity in Post-hoc Methods},
  author = {Mahdi Dhaini and Ege Erdogan and Nils Feldhus and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2505.01198},
  year   = {2025}
}

备注

Accepted to ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2025