中文

双重麻烦:如何不用掩码语言模型合成的反事实解释文本分类器的决策?

计算与语言 2022-10-12 v4 人工智能

摘要

数十种归因方法背后的原理是,将输入特征(此处为一个词元)被移除前后的预测差异作为其归因。一种流行的输入边缘化(IM)方法(Kim et al., 2020)使用 BERT 替换词元,产生更合理的反事实。虽然 Kim et al. (2020) 报告 IM 有效,但我们发现该结论不可信,因为其论文中使用的 DeletionBERT 度量偏向于 IM。重要的是,这种偏差存在于基于删除的度量中,包括 Insertion、Sufficiency 和 Comprehensiveness。此外,我们使用 6 种度量和 3 个数据集的严格评估未发现任何证据表明 IM 优于留一法(LOO)基线。我们发现 IM 不优于 LOO 的两个原因:(1)从输入中删除单个词仅边际降低分类器准确率;(2)高度可预测的词总被赋予近零归因,无论其对分类器的真实重要性如何。相反,通过 BERT 使 LIME 样本更自然在若干 ROAR 度量下持续提升 LIME 准确率。

关键词

引用

@article{arxiv.2110.11929,
  title  = {Double Trouble: How to not explain a text classifier's decisions using counterfactuals synthesized by masked language models?},
  author = {Thang M. Pham and Trung Bui and Long Mai and Anh Nguyen},
  journal= {arXiv preprint arXiv:2110.11929},
  year   = {2022}
}

备注

9 pages. Long paper to appear at AACL-IJCNLP 2022