中文

通过最小对比编辑(MiCE)解释NLP模型

计算与语言 2021-06-25 v2 人工智能

摘要

研究表明人类会给出对比性解释,即解释为何观察到某事件发生而非某个其他反事实事件(对比情形)。尽管对比性在人类解释方式中起着重要影响,但当前解释 NLP 模型的方法大体上缺失这一属性。我们提出最小对比编辑(MiCE),一种以编辑输入的形式产生模型预测的对比性解释的方法,这些编辑将模型输出改变为对比情形。我们在三项任务——二分类情感分类、主题分类和多项选择题问答——上的实验表明,MiCE 能够产生不仅具有对比性,而且最小且流畅、与人类对比编辑一致的编辑。我们展示了 MiCE 编辑如何用于 NLP 系统开发中的两个用例——调试错误的模型输出和揭示数据集伪影——并由此说明产生对比性解释是模型可解释性的一个有前景的研究方向。

关键词

引用

@article{arxiv.2012.13985,
  title  = {Explaining NLP Models via Minimal Contrastive Editing (MiCE)},
  author = {Alexis Ross and Ana Marasović and Matthew E. Peters},
  journal= {arXiv preprint arXiv:2012.13985},
  year   = {2021}
}