评估解释在 Rashomon 集中消歧模型的能力
人工智能
2026-01-14 v1 机器学习
机器学习
摘要
可解释人工智能(XAI)致力于产生指示模型内部运作机制的解释。对于一组性能相似的 Rashomon 集模型,解释提供了一种消歧单个模型行为的方法,有助于选择用于部署的模型。然而,解释本身也会因所使用的解释器而异,因此需要进行评估。在论文《在没有真实值的情况下评估模型解释》中,我们提出了三条解释评估原则以及一种评估特征重要性解释质量的新方法“AXE”。我们进一步说明,依赖于将模型解释与理想的真实值解释进行比较的评估指标,会掩盖 Rashomon 集内的行为差异。而与我们提出的原则相一致的评估解释则会凸显这些差异,从而有助于从 Rashomon 集中选择模型。从 Rashomon 集中选择替代模型可以保持相同的预测结果,但会误导解释器生成虚假解释,并误导评估方法认为这些虚假解释具有高质量。我们提出的解释评估方法 AXE 能够以 100% 的成功率检测出这种解释的对抗性洗白。与先前基于模型敏感性或真实值比较的解释评估策略不同,AXE 能够判定何时使用了受保护属性进行预测。
关键词
引用
@article{arxiv.2601.08703,
title = {Evaluating the Ability of Explanations to Disambiguate Models in a Rashomon Set},
author = {Kaivalya Rawal and Eoin Delaney and Zihao Fu and Sandra Wachter and Chris Russell},
journal= {arXiv preprint arXiv:2601.08703},
year = {2026}
}
备注
This is a preprint of the paper published at the MURE workshop, AAAI 2026, which builds on a preprint of separate work published at FAccT 2025 (arXiv:2505.10399)