中文

Triplot:考虑层次相关结构的预测模型中变量重要性的模型无关度量与可视化

机器学习 2021-04-09 v1

摘要

预测模型解释性分析的关键要素之一是评估各个变量的重要性。预测模型探索领域(亦称可解释人工智能或可解释机器学习)的快速发展使得局部(实例层面)与全局(数据集层面)方法的普及,如排列变量重要性、Shapley 值(SHAP)、局部可解释模型解释(LIME)、Break Down 等。然而,这些方法未利用特征间相关性信息,显著降低了模型行为的可解释性。本工作中,我们提出利用变量间相关性信息来支持模型分析的新方法。数据集层面的方面重要性度量受块排列过程启发,而实例层面的方面重要性度量受 LIME 方法启发。我们展示了如何分析变量组(方面),无论其由用户给定,还是应基于变量间相关性的层次结构自动确定。此外,我们提出了一种新型模型可视化——triplot,其利用变量分组的层次结构产生高信息密度的模型可视化。该可视化为局部或全局模型与数据探索提供了一致性图示。我们还展示了一个含 5k 实例与 37 个特征的真实数据例子,其中变量间显著相关性影响了变量重要性效应的解释。据我们所知,所提方法是首个允许在探索性模型分析中直接利用变量间相关性的方法。

关键词

引用

@article{arxiv.2104.03403,
  title  = {Triplot: model agnostic measures and visualisations for variable importance in predictive models that take into account the hierarchical correlation structure},
  author = {Katarzyna Pekala and Katarzyna Woznica and Przemyslaw Biecek},
  journal= {arXiv preprint arXiv:2104.03403},
  year   = {2021}
}