中文

关于树集成可解释性方法的可信度

机器学习 2021-10-04 v1

摘要

近来机器学习模型在医疗、刑事司法和金融等关键领域的部署增加,凸显了对可信方法的需要,这些方法能够向利益相关者解释这些模型。特征重要性方法(如增益和SHAP)是用于满足该需求的最受欢迎的可解释性方法之一。任何可解释性技术要可信且有意义,必须提供准确且稳定的解释。尽管局部特征重要性方法(解释单个预测)的稳定性此前已被研究,但关于全局特征重要性方法(对整个模型的解释)的稳定性仍存在知识空白。此外,尚无研究评估和比较全局特征重要性方法在特征排序方面的准确性。本文通过在与仿真以及四个真实世界数据集上进行的综合实验,评估全局特征重要性方法的准确性和稳定性。我们聚焦于基于树的集成方法,因其广泛用于工业界,并在两种情形下度量解释的准确性与稳定性:1)输入受扰动时;2)模型受扰动时。我们的发现提供了这些方法在多种设置下的比较,并通过指出其在有和无噪声输入时均缺乏准确性,以及相对于以下方面的缺乏稳定性:1)输入维度增加或数据中的噪声;2)由不同随机种子或超参数设置初始化的模型中的扰动,揭示了全局特征重要性方法的局限性。

关键词

引用

@article{arxiv.2110.00086,
  title  = {On the Trustworthiness of Tree Ensemble Explainability Methods},
  author = {Angeline Yasodhara and Azin Asgarian and Diego Huang and Parinaz Sobhani},
  journal= {arXiv preprint arXiv:2110.00086},
  year   = {2021}
}