中文

对 counterfactual 解释的指标是否与用户感知一致?

人工智能 2026-03-17 v1 人机交互

摘要

可解释性被广泛视为可信赖人工智能系统的关键要素。然而,评估 counterfactual 解释常用的指标是算法评估指标,很少被验证是否与人类对解释质量的判断一致。这引出了一个问题:这些指标是否能有意义地反映用户的感知。我们通过一个实证研究来回答这个问题,该研究直接比较了算法评估指标与人类判断。在三个数据集上,参与者沿多个感知质量维度对 counterfactual 解释进行评级,并将其与一系列标准 counterfactual 指标相关联。我们分析了单个指标之间的关系以及组合指标预测人类评估的程度。我们的结果表明,算法指标与人类评分之间的相关性通常较弱且高度数据集依赖。此外,增加预测模型中使用的指标数量并不会导致可靠的改进,表明当前指标在捕捉人类相关标准方面存在结构性局限。总体而言,我们的发现表明,广泛使用的 counterfactual 评估指标未能反映用户感知的解释质量的关键方面,强调需要更以人类为中心的方法来评估可解释人工智能。

关键词

引用

@article{arxiv.2603.15607,
  title  = {Do Metrics for Counterfactual Explanations Align with User Perception?},
  author = {Felix Liedeker and Basil Ell and Philipp Cimiano and Christoph Düsing},
  journal= {arXiv preprint arXiv:2603.15607},
  year   = {2026}
}

备注

Accepted at the 4th World Conference on eXplainable Artificial Intelligence (XAI 2026)