中文

DeepFaith:面向高度忠实解释的领域无关且模型无关的统一框架

机器学习 2025-08-06 v1 人工智能

摘要

可解释人工智能(XAI)通过揭示决策依据的方法来建立复杂系统信任。然而,由于缺乏统一的最优解释,现有 XAI 方法缺乏客观评估和优化的基准。为此,我们提出基于深度架构的忠实解释器(DeepFaith),这是一种在忠实性视角下构建的领域无关且模型无关的统一解释框架。通过建立多个广泛使用且经验证的忠实性指标的统一表述,我们导出一个最优解释目标,其解决方案同时在这些指标上实现最优忠实性,从而从理论角度提供了基准。我们设计了一个解释器学习框架,利用多个现有解释方法,应用去重和过滤构建高质量的监督解释信号,并优化模式一致性损失和局部相关性以训练忠实的解释器。训练完成后,DeepFaith 能够通过单个前向传播生成高度忠实的解释,无需访问被解释的模型。在涵盖 6 个模型和 6 个数据集的 12 个 diverse explanation 任务上,DeepFaith 在 10 个指标上相较于所有基线方法实现最高的整体忠实性,凸显了其有效性和跨领域的通用性。

关键词

引用

@article{arxiv.2508.03586,
  title  = {DeepFaith: A Domain-Free and Model-Agnostic Unified Framework for Highly Faithful Explanations},
  author = {Yuhan Guo and Lizhong Ding and Shihan Jia and Yanyu Ren and Pengqi Li and Jiarun Fu and Changsheng Li and Ye yuan and Guoren Wang},
  journal= {arXiv preprint arXiv:2508.03586},
  year   = {2025}
}

备注

22 pages