中文

可解释性中的分布外问题及特征重要性解释的搜索方法

机器学习 2021-10-29 v2 人工智能 计算与语言

摘要

特征重要性(FI)估计是一种流行的解释形式,通常通过在测试时移除某些输入特征来计算模型置信度的变化来创建和评估。例如,在标准充分性(Sufficiency)度量中,仅保留前k个最重要的词元。在本文中,我们研究了FI解释的若干未被充分探索的维度,为这种解释形式提供了概念和实证上的改进。首先,我们提出了一个新的论点,说明在创建或评估解释时从输入中移除特征为何可能存在问题:这些反事实输入相对于模型是分布外(OOD)的这一事实意味着所得解释在社会层面是对齐不良的。问题的关键在于模型先验和随机权重初始化以非预期的方式影响了(以及解释度量)。为解决此问题,我们提出了对模型训练过程的一个简单改动,从而得到更具社会对齐性的解释和度量。其次,我们比较了五种从模型输入中移除特征的方法。我们发现某些方法比其他方法产生更多的OOD反事实,并针对特征替换函数的选择给出了建议。最后,我们引入了四种基于搜索的方法来识别FI解释,并将其与包括LIME、Anchors和Integrated Gradients在内的强基线进行比较。通过对六个多样化文本分类数据集的实验,我们发现唯一持续优于随机搜索的方法是我们在本文提出的并行局部搜索(PLS)。相对于次优方法的改进在充分性上高达5.4个点,在完备性(Comprehensiveness)上高达17个点。本文实验的所有支持代码已在 https://github.com/peterbhase/ExplanationSearch 公开。

关键词

引用

@article{arxiv.2106.00786,
  title  = {The Out-of-Distribution Problem in Explainability and Search Methods for Feature Importance Explanations},
  author = {Peter Hase and Harry Xie and Mohit Bansal},
  journal= {arXiv preprint arXiv:2106.00786},
  year   = {2021}
}

备注

NeurIPS 2021 (25 pages)