探索可解释 AI 的迷宫:评估方法与度量的系统性方法
计算机视觉与模式识别
2025-01-03 v3
摘要
可解释 AI (XAI) 是一个快速发展的领域,提出了大量方法以及旨在评估其有效性的度量。然而,当前的研究通常范围有限,仅检查少数 XAI 方法,并忽略了影响性能的底层设计参数,如模型架构或输入数据的性质。此外,它们通常依赖于一两个度量而忽视彻底的验证,增加了选择偏差的风险并忽略了度量之间的差异。这些缺陷使从业者困惑于如何为其问题选择合适的方法。作为回应,我们引入了 LATEC,这是一个大规模基准,使用 20 个不同的度量对 17 种著名的 XAI 方法进行了批判性评估。我们系统地纳入了重要的设计参数,如不同的架构和多样的输入模态,产生了 7,560 种被检查的组合。通过 LATEC,我们展示了度量冲突导致不可靠排名的高风险,并因此提出了一种更稳健的评估方案。此外,我们全面评估了各种 XAI 方法,以协助从业者选择符合其需求的合适方法。令人好奇的是,表现最佳的新兴方法 Expected Gradients 在任何相关的相关研究中都未被检查过。LATEC 通过公开发布所有 326k 显著性图和 378k 度量分数作为(元)评估数据集,巩固了其在未来 XAI 研究中的地位。该基准托管于:https://github.com/IML-DKFZ/latec。
引用
@article{arxiv.2409.16756,
title = {Navigating the Maze of Explainable AI: A Systematic Approach to Evaluating Methods and Metrics},
author = {Lukas Klein and Carsten T. Lüth and Udo Schlegel and Till J. Bungert and Mennatallah El-Assady and Paul F. Jäger},
journal= {arXiv preprint arXiv:2409.16756},
year = {2025}
}
备注
Accepted at NeurIPS 2024