中文

用于衡量可解释性方法质量的解释质量分数

计算与语言 2023-11-02 v1 机器学习

摘要

近年来,机器学习(ML)模型已应用于广泛的自然语言处理(NLP)任务。除做出准确决策外,理解模型如何决策在许多应用中的必要性已变得显而易见。为此,许多有助于解释 ML 模型决策过程的可解释性方法被开发出来。然而,目前尚不存在广泛接受的指标来评估这些方法所生成解释的质量。因此,当前没有标准方法来衡量可解释性方法在多大程度上实现了预期目标。此外,也没有公认的性能标准来比较和排序现有可解释性方法。在本文中,我们提出一种量化可解释性方法所生成解释质量的新指标。我们使用六种可解释性方法在三个 NLP 任务上计算该指标并展示结果。

关键词

引用

@article{arxiv.2205.12254,
  title  = {Interpretation Quality Score for Measuring the Quality of interpretability methods},
  author = {Sean Xie and Soroush Vosoughi and Saeed Hassanpour},
  journal= {arXiv preprint arXiv:2205.12254},
  year   = {2023}
}