中文

基于白盒模型评估局部解释

机器学习 2022-01-31 v2 机器学习

摘要

使用人类受试者评估解释技术成本高、耗时长,且可能导致评估中的主观性。为评估局部解释的准确性,我们需要获取给定实例的真实特征重要性分数。然而,模型的预测函数通常不能分解为指示某特征对输出贡献多少的线性加性项。在本工作中,我们建议转而关注预测函数的对数优势比(LOR),其对逻辑回归与朴素贝叶斯自然分解为加性项。我们展示了如何基于所提方法,依据与 LOR 分数的相似性来基准测试不同解释技术。在实验中,我们比较了知名的局部解释技术,发现这些技术的性能可能依赖于底层模型、数据集、被解释的数据点、数据的归一化以及相似性度量。

关键词

引用

@article{arxiv.2106.02488,
  title  = {Evaluating Local Explanations using White-box Models},
  author = {Amir Hossein Akhavan Rahnama and Judith Butepage and Pierre Geurts and Henrik Bostrom},
  journal= {arXiv preprint arXiv:2106.02488},
  year   = {2022}
}

备注

Submitted to ACM FaCCT 2022 Jan 21 2022, 13 pages, 4 Figures