无真实答案时评估模型解释
人工智能
2025-05-16 v1 机器学习
摘要
对于单个模型预测,可能存在众多相互竞争且矛盾的解释,导致难以选择。当前的解释评估框架通过将质量与理想的“真实答案”解释进行比较,或验证模型对重要输入的敏感性来衡量。我们概述了这些方法的局限性,并提出了三个理想原则,以为未来的解释评估策略奠定基础。我们提出了无需访问理想真实答案解释的 Agnostic eXplanation Evaluation 框架(AXE),以满足这些原则。与先前方法不同,AXE 不需要访问理想的真实答案解释进行比较,也不依赖模型敏感性——从而提供一种独立的解释质量度量。我们通过与基线方法进行比较来验证 AXE,并展示了其如何用于检测解释掩饰。我们的代码已公开于 https://github.com/KaiRawal/Evaluating-Model-Explanations-without-Ground-Truth。
引用
@article{arxiv.2505.10399,
title = {Evaluating Model Explanations without Ground Truth},
author = {Kaivalya Rawal and Zihao Fu and Eoin Delaney and Chris Russell},
journal= {arXiv preprint arXiv:2505.10399},
year = {2025}
}
备注
https://github.com/KaiRawal/Evaluating-Model-Explanations-without-Ground-Truth