中文

基于扰动-梯度共识归因的可解释人工智能方法透明度评估与增强统一框架

人工智能 2026-04-10 v3

摘要

可解释人工智能(XAI)方法在安全关键领域日益受到使用,但尚无统一框架能够同时评估忠实度、可解释性、鲁棒性、公平性和完整性。我们通过两个贡献来解决这一问题。首先,我们提出了多准则评估框架,通过原则化指标正式化这五个标准:通过预测间隙分析实现忠实度;通过复合浓度-连贯性-对比度得分实现可解释性;通过余弦相似性扰动稳定性实现鲁棒性;通过跨人口统计组的 Jensen-Shannon 发散实现公平性;通过特征剥离覆盖率实现完整性。这些指标集成到一个熵加权动态评分方案中,该方案适应特定领域的优先级。其次,我们引入扰动-梯度共识归因(PGCA),通过共识放大和自适应对比度增强,将基于网格的扰动重要性与 Grad-CAM++ 融合,结合扰动忠实度与梯度基于空间精度。我们在五个领域(脑肿瘤MRI、植物疾病、安检、性别、太阳镜检测)上进行评估,使用在ResNet-50模型上微调的模型。PGCA在忠实度 (2.22±1.62)(2.22 \pm 1.62)、可解释性 (3.89±0.33)(3.89 \pm 0.33) 和公平性 (4.95±0.03)(4.95 \pm 0.03) 上取得最佳性能,在基线方法上具有统计显著优势 (p<107)(p < 10^{-7})。敏感性分析显示排名稳定(Kendall's (τ0.88))(\tau \geq 0.88))。代码和结果已公开。

关键词

引用

@article{arxiv.2412.03884,
  title  = {A Unified Framework for Evaluating and Enhancing the Transparency of Explainable AI Methods via Perturbation-Gradient Consensus Attribution},
  author = {Md. Ariful Islam and Md Abrar Jahin and M. F. Mridha and Nilanjan Dey},
  journal= {arXiv preprint arXiv:2412.03884},
  year   = {2026}
}