中文

F-Fidelity:一种可靠的可解释人工智能忠诚度评估框架

机器学习 2025-03-10 v2 人工智能

摘要

近期研究开发了各种可解释人工智能(XAI)技术,如梯度方法、输入扰动方法和黑箱解释方法。虽然这些 XAI 技术可以从深度学习模型中提取有意义的见解,但如何对它们进行恰当的评估仍是一个开放问题。最常用的方法是扰动甚至移除 XAI 方法认为最重要的输入特征,并观察预测输出的变化。这种方法虽然直观,但存在离分布外(Out-of-Distribution, OOD)问题,因为扰动样本可能不再遵循原始数据分布。最近的方法 RemOve And Retrain(ROAR)通过依据解释进行 retraining 来解决 OOD 问题。然而,使用基于 XAI 方法 retrain 的模型来评估这些解释器可能导致信息泄露,从而导致不公平的比较。我们提出 Fine-tuned Fidelity(F-Fidelity),一种可靠的 XAI 评估框架,利用 i) 解释不可知的 fine-tuning 策略,以缓解信息泄露问题;ii) 随机遮盖操作,确保移除步骤不生成 OOD 输入。我们还设计了以最新解释器及其降级版本为基准的受控实验,以验证该框架的正确性。在图像、时间序列和自然语言等多个数据模态上进行实验。结果表明,F-Fidelity 在恢复解释器的真实排序方面显著优于先前评估指标。此外,我们在理论和实证方面表明,给定忠诚的解释器,F-Fidelity 指标可用于计算影响输入组件的稀疏度,即提取真实解释大小。

关键词

引用

@article{arxiv.2410.02970,
  title  = {F-Fidelity: A Robust Framework for Faithfulness Evaluation of Explainable AI},
  author = {Xu Zheng and Farhad Shirani and Zhuomin Chen and Chaohao Lin and Wei Cheng and Wenbo Guo and Dongsheng Luo},
  journal= {arXiv preprint arXiv:2410.02970},
  year   = {2025}
}

备注

Accepted to International Conference on Learning Representations (ICLR 2025); 33 Pages, 5 figures, 26 Tables