中文

解释器发散分数(EDS):某些事后解释或可有效检测未知虚假关联

机器学习 2022-11-16 v1 人工智能

摘要

近期的研究表明,事后解释器可能在深度神经网络(DNNs)中检测虚假关联方面无效。然而,我们展示了现有针对该设置的评估框架存在严重缺陷。先前提出的指标极难解释,且无法在解释器方法之间直接比较。为缓解这些限制,我们提出了一种新的评估方法——解释器发散分数(EDS),其基于信息论方法来评估解释器。EDS 易于解释,且天然可在不同解释器间进行比较。我们使用我们的方法在两个不同的图像数据集上比较了三种不同解释器的检测性能——特征归因方法、影响样本和概念提取。我们发现事后解释器通常包含关于 DNN 对虚假伪影依赖性的大量信息,但以人类用户往往难以察觉的方式呈现。这表明需要新技术来利用这些信息以更好地检测 DNN 对虚假关联的依赖。

关键词

引用

@article{arxiv.2211.07650,
  title  = {Explainer Divergence Scores (EDS): Some Post-Hoc Explanations May be Effective for Detecting Unknown Spurious Correlations},
  author = {Shea Cardozo and Gabriel Islas Montero and Dmitry Kazhdan and Botty Dimanov and Maleakhi Wijaya and Mateja Jamnik and Pietro Lio},
  journal= {arXiv preprint arXiv:2211.07650},
  year   = {2022}
}

备注

Presented at the AIMLAI workshop at the 31st ACM International Conference on Information and Knowledge Management (CIKM 2022)