重新审视可解释人工智能评估指标以识别最具信息量的特征
机器学习
2025-02-04 v1 机器学习
摘要
基于功能性或代理的方法是评估可解释人工智能方法质量的常用方法之一。它使用统计方法、定义和新开发的指标进行评估,无需人工干预。其中,选择性(Selectivity)或移除并重训(ROAR),以及排列重要性(PI)是最常用的指标,用于评估可解释人工智能方法在机器学习模型中突出最重要特征的质量。这些指标指出,如果从模型中移除或排列最具信息量的特征,模型性能应经历急剧下降。然而,这两个指标的效率受到多重共线性、模型中显著特征的数量以及模型准确率的显著影响。本文通过实证例子表明,这两个指标都受到上述限制的影响。因此,我们提出了预期准确率区间(EAI),这是一个用于预测实施ROAR或IP时模型准确率上下界的指标。发现所提出的指标非常有用,尤其是在存在共线特征的情况下。
引用
@article{arxiv.2502.00088,
title = {Re-Visiting Explainable AI Evaluation Metrics to Identify The Most Informative Features},
author = {Ahmed M. Salih},
journal= {arXiv preprint arXiv:2502.00088},
year = {2025}
}