中文

用于解释基于树的方法与替代模型的公平特征重要性分数

机器学习 2023-10-09 v1 机器学习

摘要

在医疗、刑事司法、国家安全、金融和科技等各个领域,大规模机器学习(ML)和人工智能(AI)系统正被部署以做出关键的数据驱动决策。许多人质疑我们能否且应否信任这些 ML 系统来做这些决策。信任 ML 系统的两个关键先决条件是:可解释性,即理解 ML 系统为何做出其所做决策的能力;以及公平性,确保 ML 系统不对某些个人或群体表现出偏见。可解释性与公平性都很重要,且在 ML 文献中已分别受到大量关注,但迄今为止,直接针对模型公平性进行解释的方法极少。本文关注可谓最流行的 ML 解释类型:特征重要性分数。受决策树在知识蒸馏中使用的启发,我们提议利用树作为复杂黑盒 ML 模型的可解释替代模型。具体而言,我们为树开发了一种新颖的公平特征重要性分数,可用于解释每个特征如何对树、基于树的集成或任何复杂 ML 系统的基于树的替代模型中的公平性或偏见做出贡献。如同流行的树的 impurity 平均减少量,我们的公平特征重要性分数基于群体偏见的平均减少(或增加)量定义。通过仿真以及在基准公平性数据集上的真实示例,我们证明了我们的公平特征重要性分数对基于树的集成和其他 ML 系统的基于树的替代模型均能提供有效解释。

关键词

引用

@article{arxiv.2310.04352,
  title  = {Fair Feature Importance Scores for Interpreting Tree-Based Methods and Surrogates},
  author = {Camille Olivia Little and Debolina Halder Lina and Genevera I. Allen},
  journal= {arXiv preprint arXiv:2310.04352},
  year   = {2023}
}