中文

解释文本分类器的必要性与充分性:以仇恨言论检测为例

计算与语言 2022-05-09 v1

摘要

我们提出了一种用于解释文本分类器的新颖特征归因方法,并在仇恨言论检测背景下对其进行分析。尽管特征归因模型通常为每个词元提供单一重要性分数,我们转而提供两个互补且理论有据的分数——必要性与充分性——从而产生更具信息量的解释。我们提出了一种透明方法,通过生成输入文本的显式扰动来计算这些值,使重要性分数本身可被解释。我们运用该方法在同一测试套件中精选的样例集上解释不同仇恨言论检测模型的预测,并表明身份词的必要性与充分性不同取值对应于不同类型的假阳性错误,揭示了分类器对边缘化群体的偏倚来源。

关键词

引用

@article{arxiv.2205.03302,
  title  = {Necessity and Sufficiency for Explaining Text Classifiers: A Case Study in Hate Speech Detection},
  author = {Esma Balkir and Isar Nejadgholi and Kathleen C. Fraser and Svetlana Kiritchenko},
  journal= {arXiv preprint arXiv:2205.03302},
  year   = {2022}
}

备注

NAACL 2022