特征重要性取决于数据属性:致力于为数据与决策树模型选择正确的解释
机器学习
2025-02-12 v1 人工智能
摘要
为了确保机器学习模型解释的可靠性,必须确立其优势与局限,以及在何种情况下各方法能够发挥作用。然而,当前对何时如何使用每种解释方法的理解仍不足。为填补这一空白,我们通过综合多个具有所需属性的数据集进行全面经验评估。我们的主要目标是评估由局部解释方法提供的特征重要性估计质量,这些方法用于解释由决策树模型做出的预测。通过分析来自合成数据集以及公开可用的二元分类数据集的结果,我们观察到这些方法生成的特征重要性估计在幅度和符号上存在显著差异。此外,我们发现这些估计对特定数据属性敏感。尽管一些模型超参数并不显著影响特征重要性分配,但重要的是要认识到每种解释方法在特定情境下都有局限性。我们的评估揭示了这些局限性,并为在不同情境下不同解释方法的适合性与可靠性提供了宝贵的见解。
引用
@article{arxiv.2502.07153,
title = {Feature Importance Depends on Properties of the Data: Towards Choosing the Correct Explanations for Your Data and Decision Trees based Models},
author = {Célia Wafa Ayad and Thomas Bonnier and Benjamin Bosch and Sonali Parbhoo and Jesse Read},
journal= {arXiv preprint arXiv:2502.07153},
year = {2025}
}