中文

CEBaB:估计真实世界概念对 NLP 模型行为的因果效应

计算与语言 2022-10-13 v2

摘要

现代 ML 系统规模和复杂度的增长提升了其预测能力,但也使其行为更难解释。作为回应,许多模型解释技术被开发出来,但我们缺乏评估这些技术的明确标准。在本文中,我们将模型解释视为因果推断问题,即在给定实际输入数据的情况下估计真实世界概念对 ML 模型输出行为的因果效应。我们引入 CEBaB,一个用于评估自然语言处理(NLP)中基于概念的解释方法的新基准数据集。CEBaB 由短餐厅评论及人工生成的_counterfactual_ 评论组成,其中用餐体验的某一方面(食物、噪音、氛围、服务)被修改。原始与反事实评论在方面级和评论级均标注了多重验证的情感评分。CEBaB 的丰富结构使我们能够超越输入特征,研究抽象的真实世界概念对模型行为的影响。我们使用 CEBaB 比较了一系列覆盖不同假设与问题概念的基于概念的解释方法的质量,并试图为这些方法的比较评估建立自然度量标准。

关键词

引用

@article{arxiv.2205.14140,
  title  = {CEBaB: Estimating the Causal Effects of Real-World Concepts on NLP Model Behavior},
  author = {Eldar David Abraham and Karel D'Oosterlinck and Amir Feder and Yair Ori Gat and Atticus Geiger and Christopher Potts and Roi Reichart and Zhengxuan Wu},
  journal= {arXiv preprint arXiv:2205.14140},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022