中文

通过统一诊断评估框架评估输入特征解释

计算与语言 2025-02-10 v2

摘要

解释机器学习模型决策过程的做法对于确保其对最终用户的可靠性和透明度至关重要。一种流行的解释形式强调关键输入特征,例如:i) 标记(如 Shapley 值和积分梯度),ii) 标记之间的相互作用(如双变量 Shapley 和注意力基于方法),或 iii) 输入片段之间的相互作用(如 Louvain 片段相互作用)。然而,这些解释类型仅在孤立的情况下研究,使人们难以判断其各自的适用性。为填补这一差距,我们开发了一个统一框架,促进了由四个诊断属性组成的高亮和交互式解释之间的自动化和直接比较。我们在两个数据集和两个模型上,对这三种输入特征解释类型——每个类型使用三种不同的解释技术——进行了广泛分析,发现每种解释在不同诊断属性上都有各自的优势。尽管交互式片段解释在大多数诊断属性上超过其他类型输入特征解释,但我们的分析强调了进一步研究改进生成这些解释类型的技术的必要性。此外,将它们与在某些特征方面表现更好的其他解释类型集成,可能进一步提高其整体效果。

关键词

引用

@article{arxiv.2406.15085,
  title  = {Evaluating Input Feature Explanations through a Unified Diagnostic Evaluation Framework},
  author = {Jingyi Sun and Pepa Atanasova and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2406.15085},
  year   = {2025}
}