中文

逆方法评估潜在解释质量分布

机器学习 2025-04-23 v1

摘要

获取高质量的模型输出解释能够帮助开发人员识别并纠正偏见,使系统行为与人类价值观相吻合,并确保伦理合规。解释性人工智能(XAI)实践者依赖特定措施来衡量此类解释的质量。这些措施评估关键属性,如解释与模型决策过程的接近程度(忠实性)、其对相关输入特征的定位准确性(局部化)以及在不同情形下的一致性(鲁棒性)。尽管这些措施提供了有价值的信息,但未能完全解决一个关键实践者关切的问题:给定解释的质量如何与其他潜在解释相比较?传统上,解释的质量通过将其与随机生成的对手进行比较来评估。本文引入了另一种方法:质量间隙估计(QGE)。QGE 方法提供了与可视为原始解释反面解释的直接比较。我们在多个模型架构、数据集和既定质量指标上进行了广泛测试,表明 QGE 方法优于传统方法。此外,我们展示了 QGE 能提高这些质量评估的统计可靠性。这一进展代表了对解释评估的重要一步,使我们能够更有效地检查模型的行为。

关键词

引用

@article{arxiv.2502.15403,
  title  = {Evaluate with the Inverse: Efficient Approximation of Latent Explanation Quality Distribution},
  author = {Carlos Eiras-Franco and Anna Hedström and Marina M. -C. Höhne},
  journal= {arXiv preprint arXiv:2502.15403},
  year   = {2025}
}

备注

Accepted to AAAI 2025