中文

让 CAT 走出黑箱:面向文本的反事实属性化解释

计算与语言 2022-11-03 v3 人工智能

摘要

用于理解黑箱模型行为的反事实解释近年来备受关注,因其具有提供补救措施的潜力。本文提出一种面向文本的反事实属性化解释方法(CAT),该方法为自然语言文本数据提供反事实解释,并带有一个新颖的转折:我们构建并利用属性分类器,从而生成语义上更有意义的解释。为确保我们生成的反事实文本相对于原始文本具有尽可能少的编辑,同时流畅且接近人工生成的反事实文本,我们采用最小扰动方法,并使用 BERT 语言模型与在可用属性上训练的属性分类器进行正则化。我们通过定性示例与用户研究表明,我们的方法不仅因这些属性传达了更多洞察,还产生了更高质量的(反事实)文本。在定量上,我们表明我们的方法在四个数据集上的四个基准指标上优于其他最先进的方法。

关键词

引用

@article{arxiv.2109.07983,
  title  = {Let the CAT out of the bag: Contrastive Attributed explanations for Text},
  author = {Saneem Chemmengath and Amar Prakash Azad and Ronny Luss and Amit Dhurandhar},
  journal= {arXiv preprint arXiv:2109.07983},
  year   = {2022}
}