中文

一种基于后门的可解释人工智能基准,用于高保真度评估归因方法

密码学与安全 2025-10-02 v2 人工智能 机器学习

摘要

归因方法计算输入特征的重要性分数以解释模型预测。然而,由于缺乏模型预测的归因真实值,评估这些方法的忠实度仍然具有挑战性。在这项工作中,我们首先确定了一组可靠的归因方法基准应满足的忠实度标准,从而促进对归因基准的系统性评估。接下来,我们引入了一个基于后门的可解释人工智能基准(BackX),该基准遵循所期望的忠实度标准。我们从理论上证明了我们的方法在提供有根据的归因评估方面优于现有基准。通过广泛的分析,我们进一步建立了一个标准化的评估设置,该设置减轻了诸如后处理技术和被解释的预测等混杂因素,从而确保了公平且一致的基准测试。最终,此设置被用于使用 BackX 对现有方法进行全面比较。最后,我们的分析还为利用归因方法防御神经木马提供了见解。

关键词

引用

@article{arxiv.2405.02344,
  title  = {A Backdoor-based Explainable AI Benchmark for High Fidelity Evaluation of Attributions},
  author = {Peiyu Yang and Naveed Akhtar and Jiantong Jiang and Ajmal Mian},
  journal= {arXiv preprint arXiv:2405.02344},
  year   = {2025}
}